GPT-5.6 Sol token 在 Codex 中的使用分析
我在 Codex CLI 上做了 280+ 次 GPT 5.6 Sol 测试。当前版本似乎仍有会增加 token 消耗的问题。 在多数基准中,GPT 5.6 Sol 的成本效益优于 GPT 5.5 。以 DeepSWE 为例:5.5 High 平均每任务 5.1 美元,5.6 S…
查看“算法”话题下的最新内容。
我在 Codex CLI 上做了 280+ 次 GPT 5.6 Sol 测试。当前版本似乎仍有会增加 token 消耗的问题。 在多数基准中,GPT 5.6 Sol 的成本效益优于 GPT 5.5 。以 DeepSWE 为例:5.5 High 平均每任务 5.1 美元,5.6 S…