最严苛 AI 交互推理测试:OpenAI 两项改进让 GPT-5.6 Sol 提分 188%
IT之家 7 月 31 日消息,OpenAI 公司今天(7 月 31 日)发布公告,宣布通过改进框架,**让 GPT-5.6 Sol 模型的 ARC-AGI-3 提高了 188%。**

IT之家注:ARC-AGI-3 由 ARC Prize 团队推出的全新交互式推理基准测试,是目前全球公认衡量 AI 通用智能(AGI)最严苛、最顶尖的交互式推理评测基准。
该基准完全打破了传统 AI“做题”和知识问答的静态测试模式,将 AI 直接扔进一个完全陌生的“游戏环境”中,来评估其是否具备像人类一样的实时探索、学习与自适应能力。

在未调整优化前,GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的得分为 7.8%,而 GPT-5.5 模型的得分只有 0.4%。
OpenAI 公司在复盘后发现,GPT-5.6 系列模型官方框架存在 2 个影响 GPT-5.6 Sol 表现的机制:
- **第一,**每次游戏动作后,私有推理都会被丢弃。这意味着 GPT-5.6 Sol 每执行 1 次动作后,都需要重新理解游戏。模型仍可看到过去动作记录和简短备注,但看不到促成这些动作的计划、洞察和思考过程。
- **第二,**官方框架采用滚动截断窗口。随着历史变长,较早动作会从上下文中消失。也就是说,GPT-5.6 Sol 不仅无法保留过去思考,也会丢失过去动作记忆。
针对上述问题,OpenAI 提出了推理保留(inference preservation)和上下文压缩(context compression)两个解决方案。
推理保留方面,OpenAI 使用 Responses API 重新实现 ARC-AGI-3 测试框架,对于 GPT-5.6,只需传入前一次 response ID,即可在工具调用和多轮交互中自动保留推理。

OpenAI 表示在启用推理保留后,GPT-5.6 不必每轮重新解释游戏,从而减少每次动作前花在思考上的时间,模型保留过去想法后,更善于随时间学习,并采用更连贯的策略。
在上下文压缩方面,官方 ARC-AGI-3 框架在对话上下文超过 175000 个字符后,会丢弃最早消息。OpenAI 称,滚动截断有 2 个缺点:模型会丢失早期观察和动作;模型在任务的大部分时间里会带着更满的上下文窗口运行,这可能轻微损害表现。
启用上下文压缩后,GPT-5.6 Sol 在较长任务中更能保留对每个游戏的已学信息,并以更少输出 token 获得更高得分。

而在使用官方 harness 后,GPT-5.6 Sol 在 ARC-AGI-3 的得分为 13.3%;在启用推理保留(inference preservation)和上下文压缩(context compression)后,**GPT-5.6 Sol 在 Token 输出数量降低至六分之一的同时,得分达到 38.3%,成绩增长 188.42%。**

harness(常被称为驭缰工程)是指包在大模型外部、为其提供运行环境、工具集成、规则约束与反馈机制的整套系统架构。
如果把强大的 AI 模型比作一匹充满力量但容易失控的烈马,那么 harness 就是它的缰绳、马鞍与骑手路线,不改变模型本身的架构,而是决定模型如何被安全、可靠地驾驭并真正完成复杂工作。

---
原文链接:[点击查看](https://www.ithome.com/0/984/208.htm)

IT之家注:ARC-AGI-3 由 ARC Prize 团队推出的全新交互式推理基准测试,是目前全球公认衡量 AI 通用智能(AGI)最严苛、最顶尖的交互式推理评测基准。
该基准完全打破了传统 AI“做题”和知识问答的静态测试模式,将 AI 直接扔进一个完全陌生的“游戏环境”中,来评估其是否具备像人类一样的实时探索、学习与自适应能力。

在未调整优化前,GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的得分为 7.8%,而 GPT-5.5 模型的得分只有 0.4%。
OpenAI 公司在复盘后发现,GPT-5.6 系列模型官方框架存在 2 个影响 GPT-5.6 Sol 表现的机制:
- **第一,**每次游戏动作后,私有推理都会被丢弃。这意味着 GPT-5.6 Sol 每执行 1 次动作后,都需要重新理解游戏。模型仍可看到过去动作记录和简短备注,但看不到促成这些动作的计划、洞察和思考过程。
- **第二,**官方框架采用滚动截断窗口。随着历史变长,较早动作会从上下文中消失。也就是说,GPT-5.6 Sol 不仅无法保留过去思考,也会丢失过去动作记忆。
针对上述问题,OpenAI 提出了推理保留(inference preservation)和上下文压缩(context compression)两个解决方案。
推理保留方面,OpenAI 使用 Responses API 重新实现 ARC-AGI-3 测试框架,对于 GPT-5.6,只需传入前一次 response ID,即可在工具调用和多轮交互中自动保留推理。

OpenAI 表示在启用推理保留后,GPT-5.6 不必每轮重新解释游戏,从而减少每次动作前花在思考上的时间,模型保留过去想法后,更善于随时间学习,并采用更连贯的策略。
在上下文压缩方面,官方 ARC-AGI-3 框架在对话上下文超过 175000 个字符后,会丢弃最早消息。OpenAI 称,滚动截断有 2 个缺点:模型会丢失早期观察和动作;模型在任务的大部分时间里会带着更满的上下文窗口运行,这可能轻微损害表现。
启用上下文压缩后,GPT-5.6 Sol 在较长任务中更能保留对每个游戏的已学信息,并以更少输出 token 获得更高得分。

而在使用官方 harness 后,GPT-5.6 Sol 在 ARC-AGI-3 的得分为 13.3%;在启用推理保留(inference preservation)和上下文压缩(context compression)后,**GPT-5.6 Sol 在 Token 输出数量降低至六分之一的同时,得分达到 38.3%,成绩增长 188.42%。**

harness(常被称为驭缰工程)是指包在大模型外部、为其提供运行环境、工具集成、规则约束与反馈机制的整套系统架构。
如果把强大的 AI 模型比作一匹充满力量但容易失控的烈马,那么 harness 就是它的缰绳、马鞍与骑手路线,不改变模型本身的架构,而是决定模型如何被安全、可靠地驾驭并真正完成复杂工作。

---
原文链接:[点击查看](https://www.ithome.com/0/984/208.htm)
评论
暂无评论。