GPT-5.6 Sol token 在 Codex 中的使用分析
我在 Codex CLI 上做了 280+ 次 GPT-5.6 Sol 测试。当前版本似乎仍有会增加 token 消耗的问题。
在多数基准中,GPT-5.6 Sol 的成本效益优于 GPT-5.5 。以 DeepSWE 为例:5.5 High 平均每任务 5.1 美元,5.6 Sol High 为 3.5 美元;但在 Codex CLI 0.144.1 ,我测到 5.6 Sol High 反而比 5.5 High 高约 21%。


可能原因是:5.5 明确使用 `multi_tool_use.parallel`,一轮可发出多个顶层工具调用; 5.6 多以单一顶层 `exec` 编排,因此每次 LLM 调用运行的命令更少( 0.97 vs 2.5 ),同一任务的轮次却约为 1.84 倍。5.6 Sol High 的花费中约 66.5% 是缓存输入 token 。
代码位置:
[执行处理程序代码](https://github.com/openai/codex/blob/rust-v0.144.1/codex-rs/core/src/tools/code_mode/execute_handler.rs#L20-L72)
我也测试了 Ponytail 、Caveman 、RTK 等省 token 插件,几乎没有降低消耗。真正有效的是在不损失结果的前提下减少 LLM 轮次。
完整报告:
[当前测试集记录](https://turaai.net/docs#benchmark-current-test-set-record)
---
原文链接:[点击查看](https://www.v2ex.com/t/1228941)
在多数基准中,GPT-5.6 Sol 的成本效益优于 GPT-5.5 。以 DeepSWE 为例:5.5 High 平均每任务 5.1 美元,5.6 Sol High 为 3.5 美元;但在 Codex CLI 0.144.1 ,我测到 5.6 Sol High 反而比 5.5 High 高约 21%。


可能原因是:5.5 明确使用 `multi_tool_use.parallel`,一轮可发出多个顶层工具调用; 5.6 多以单一顶层 `exec` 编排,因此每次 LLM 调用运行的命令更少( 0.97 vs 2.5 ),同一任务的轮次却约为 1.84 倍。5.6 Sol High 的花费中约 66.5% 是缓存输入 token 。
代码位置:
[执行处理程序代码](https://github.com/openai/codex/blob/rust-v0.144.1/codex-rs/core/src/tools/code_mode/execute_handler.rs#L20-L72)
我也测试了 Ponytail 、Caveman 、RTK 等省 token 插件,几乎没有降低消耗。真正有效的是在不损失结果的前提下减少 LLM 轮次。
完整报告:
[当前测试集记录](https://turaai.net/docs#benchmark-current-test-set-record)
---
原文链接:[点击查看](https://www.v2ex.com/t/1228941)
评论
暂无评论。