构建者指南:GPT‑5.6

发布于

# 构建者指南:GPT‑5.6

技术性经验来自于在实际生产中的初创企业

## GPT‑5.6设定了价格性能的新标准

GPT‑5.6模型系列显著降低了边缘代理的表现成本,同时推动了可能性的边界。

在本指南中,我们展示了初创企业如何利用更智能的模型选择和新的API控制,来帮助推理的连续性、多代理的协调以及通过程序化工具调用,构建更快速、更强大的代理,并以更低的成本实现。

## 更好的开箱体验

自从GPT‑5以来,每一代模型都致力于用更少的tokens处理更长期限的任务。GPT‑5.6延续了这一轨迹:实现了更强的代理性能、更低的成本,同时对底层架构的改变也最小化。

> “我们将GPT‑5.6放入我们的架构中,低推理成本为我们带来了最佳结果。它知道何时数据缺失,没有追逐错误线索,并以更少的tokens得出正确答案。”
— Izzy Miller, AI研究主管, [Hex](https://hex.tech/)

## 模型选择

历来,升级到旗舰模型并选择最高的推理能力是长期使用案例的最佳选择。这在很大程度上是因为这些模型在处理较长上下文和工具调用时显著优于成本优化模型。随着5.6系列的推出,这种情况发生了变化:通过增加测试时的计算,Luna和Terra在许多情况下可以以显著更低的成本与GPT‑5.4和5.5相媲美。

> “Luna在成本仅为一十八分之一的情况下保持了GPT‑5.5提取精度的98%。这使我们的代理在许多工作流程中以实用的价格实现高质量的文档理解。”
— Serhii Shchoholiev, 工程主管, [Hypha](https://www.hypha.co/)

> “我们对106个最艰难的浏览器任务使用Luna,完成了78%的任务,消耗约14美元。当前的SOTA模型花费大约235美元达成80%。这种能力与成本的组合对浏览器代理来说显得尤为显著。”
— Gregor Zunic, 联合创始人, [Browser Use](https://browser-use.com/)

> “Luna现已成为我们多个高吞吐量代码检索和决策建模工作负载的默认模型。对于多代理工程系统中的关键代码探索任务,它使推理成本降低了64%,响应时间减少了90%,F1得分提高了五个百分点。”
— Animesh Koratana, 创始人兼CEO, [PlayerZero](https://playerzero.ai/)

在BrowseComp任务中,这是一个基于搜索的基准,测试模型搜索晦涩事实的能力。三个月前,GPT‑5.5(特高)在该基准上得分为84.36%,共花费33.27美元。由于GPT‑5.6 Luna(特高)的推出,其得分为84.04%,花费1.33美元。我们随后进一步降低了价格。[阅读更多](https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/)关于我们最新的降价信息。

较小的5.6系列模型非常适合高容量工作负载、延迟敏感的交互,以及代理工作流程中的重复步骤。例如,如果您正在运营一家法律科技初创企业,解析手写备忘录以进行代理分析,则不必使用前沿模型处理整个案例,您现在可以利用Terra或Luna进行提取,从而显著节省成本。

## 发展响应API,提高代理效率

除了让GPT‑5.6在开箱即用时更加高效外,我们还推出了新的基本功能,以响应API以解锁进一步的增益。我们经过端到端训练的GPT‑5.6结合了三种互补的架构干预,使代理能更有效地运行:

1. **重用已完成的工作**:通过允许[推理在模型调用间保持](https://developers.openai.com/api/docs/guides/reasoning#preserve-reasoning-across-calls)以及使用[本地压缩](https://developers.openai.com/api/docs/guides/compaction)来压缩长时间运行的对话,使模型能够在较长的任务时间内保持一致性,而不必混淆或重建先前的上下文。
2. **在适当的情况下进行并行分解**:使用[本地多代理协调](https://developers.openai.com/api/docs/guides/responses-multi-agent),可以协调多个代理在并行工作流中更快速地完成复杂任务。
3. **将确定性工作移动到代码中**:使用[程序化工具调用](https://developers.openai.com/api/docs/guides/tools-programmatic-tool-calling)来过滤、聚合和协调工具输出,避免在模型的上下文窗口内处理,从而节省模型tokens,降低成本、延迟及上下文衰退。

通过以上方法结合使用,结果可以显著提升。例如,在ARC-AGI-3评测中,GPT‑5.6 Sol在标准架构上的得分为13.3%。但在启用保持推理和压缩后,得分跃升至38.3%——而输出tokens减少了近6倍。没有对模型的任何变化,但性能几乎提高了三倍。您可以在我们的[ARC-AGI-3架构调查](https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/)中阅读更多内容。

## 程序化工具调用

代理工作流程通常包含两种类型的工作:

1. 需要判断的任务
2. 主要需要移动、过滤和组合数据的工作

当代理检索100条文件,按日期过滤并识别相关交易时,模型不必在其上下文窗口中对每个中间结果进行推理。程序化工具调用允许GPT‑5.6编写JavaScript来协调工具,进行独立的并行调用,并在上下文窗口之外处理其输出。模型只需专注于需要判断的内容。

> “对于金融研究,最困难的部分在于可靠地提取文件、协调工具以及处理数字。在我们的评估中,使用程序化工具调用的GPT‑5.6在输入tokens上减少了21%的使用量,而保持了我们的标准质量。这使得代理能够进行金融研究,而不仅仅是讨论。”
— Alex Wang, 应用人工智能, [Rogo](https://rogo.com/)

## 多代理

在复杂、可并行化的任务中,跨多个代理工作流分配操作和推理可以提高任务完成速度和智能水平。在这种设置中,主要代理负责协调子代理并分配任务给它们。子代理并行追求各自的目标,最后将输出返回给主要代理以进行最终的合成。团队可以通过[在响应API中启用多代理](https://developers.openai.com/api/docs/guides/responses-multi-agent)来开始原生利用多代理。这也是ChatGPT中的超强能力设置的运作方式。

> “Qualia在开放式研究问题上运行代理团队,GPT‑5.6 Sol恰到好处。它表现出明显的改进,比我们测试的几乎所有模型完成得更快,并迅速成为我们首选的OpenAI模型。”
— E Chi, 创始人, [Quadrillion](https://quadrillion.io/)

> “GPT‑5.6是我们见过的OpenAI中最优秀的协调者。我们同时向它抛出了六个规格(编写、构建和讨论所有内容),它能毫不乱序地跟踪一切。”
— Jon Bell, 联合创始人兼首席产品官, [Obvious](https://obvious.ai/)

虽然GPT‑5.6在适当情况下具备合理生成子代理的能力,但多代理行为非常可控。指导模型何时调用子代理可以提高在额外token支出后实现更好性能的可能性。

## 提示缓存

在整个模型系列中,提示缓存TTL已延长至至少30分钟,缓存断点现在可以在模型的上下文窗口内确定性地设置。这使得初创公司显著提高了缓存命中率。

> “我们为共享的29,000-token提示添加了缓存断点和工作区特定的键,将未缓存输入减少了28%。30分钟的缓存窗口也是一次重大解锁:我们的代理可以跨多次运行重复使用同一上下文,而不是重新开始。”
— Lorenzo Gentile, AI工程师, [Ploy](https://ploy.ai/)

除了设置缓存断点,继续使用合适的[prompt_cache_key](https://developers.openai.com/api/docs/guides/prompt-caching#improve-cache-hit-rates-with-a-prompt-cache-key)将增加请求落在先前相同前缀的同一个推理引擎上的可能性,从而降低延迟。

## 结论

这些例子的共同点在于构建代理的经济性如何发生了大变化。

曾经需要在每一步都使用前沿模型的用例,现在通过使用较小的模型、调优推理努力和做出有效的架构选择,可以取得可比或更好的结果,且成本只有从前的一小部分。

我们期待看到你们构建的东西!

---

关于作者本指南由[Samarth Madduru](https://www.linkedin.com/in/samarthmadduru/)、[Prashant Mital](https://www.linkedin.com/in/pmital/)、[Dave Leo](https://www.linkedin.com/in/davidanthonyleo/)和[Julien Reiman](https://www.linkedin.com/in/julienreiman/)共同编写,基于他们从早期测试到生产,与初创企业紧密合作的经验。

---

[继续阅读](https://openai.com/news/)

![Derya Unutmaz card image](http://pic.zhso.org/2026/08/14/ad5ee409ba62.png) [如何通过GPT-5帮助免疫学家Derya Unutmaz解决一个3年的谜团 应用人工智能 2026年6月23日](https://openai.com/index/gpt-5-immunology-mystery/)

![Boston's Children Hospital NEJM > Cover image](http://pic.zhso.org/2026/08/14/a73e89be70c6.png) [利用AI帮助医生诊断罕见的儿童遗传疾病 应用人工智能 2026年6月18日](https://openai.com/index/diagnose-rare-childhood-diseases/)

![Frame (4)](http://pic.zhso.org/2026/08/14/dce3aea00dfd.png) [一位天体物理学家如何使用Codex帮助模拟黑洞 应用人工智能 2026年6月11日](https://openai.com/index/using-codex-to-simulate-black-holes/)

我们使用cookies

我们使用cookies帮助本网站运作、了解服务使用情况和支持市场营销活动。访问管理cookies更改偏好设置。

---

原文链接:[点击查看](https://openai.com/index/builders-guide-to-gpt-5-6)

评论

暂无评论。

0.056360s