GPT-5.6如何将前沿智能与前沿效率相结合
GPT-5.6如何将前沿智能与前沿效率相结合 | OpenAI
我们设计了GPT-5.6模型系列,旨在平衡[能力与成本](https://openai.com/index/gpt-5-6/),以应对人们使用我们模型时面临的任务需求。我们的旗舰模型GPT-5.6 Sol,以最强的推理能力在人工分析编码代理指数上以不到一半的成本超越了Claude Fable 5。Terra在智能基准上表现与GPT-5.5相当,但价格仅为后者的一半,而Luna是我们最快、最具性价比的模型,其价格比Sol低80%。为了实现这些效率,我们的研究和技术团队在每个主要层面上进行了重要优化。这些改进覆盖了我们的模型、推理(我们如何运行模型以生成输出)以及同时被Codex和ChatGPT Work使用的智能代理工具。
随着我们在过去四年中将模型规模扩展到10亿活跃用户和超过200万个企业,效率一直是将智能收益分配给每个人的核心。我们的使命是确保人工通用智能惠及全人类。在这些年里,我们不断致力于在整个技术堆栈中解锁更多优化,力求在每一点成本-智能曲线上提供最具性能的模型。通过GPT-5.6,我们达到了迄今为止最大的每个token智能效率,其训练目标是[每个token完成更多工作](https://openai.com/index/gpt-5-6/)。在训练过程中,我们同时优化任务成功率和效率,使模型能够更直接地完成任务。
这篇文章超越了我们的模型,分享我们在技术堆栈中的两个主要部分如何通过进步来提升效率,包括1)**推理**,通过优化负载均衡、推测解码、缓存和内核优化等过程,利用相同硬件获得更多输出,以及2)我们的**智能代理工具**,更好地管理上下文膨胀、工具使用和重复工作。我们还将分享GPT-5.6 Sol在自主实现这些增益中的作用。尽管任何单一的改进看似有限,但这些增益的叠加使我们能够在智能与效率的前沿交付方案。

### 使用GPT-5.6 Sol加速推理
在计算受限的世界中,模型需求增长速度快于计算能力,效率是每个系统设计的核心。特别是在我们的推理堆栈中,该堆栈运行经过训练的模型以生成响应。我们的主要目标是在保持用户期望的智能、延迟、可用性和可靠性的同时,为相同的硬件服务更多token。
要实现这一目标,需要优化整个系统。一个模型在孤立状态下可能高效,但如果请求分布不合理、硬件闲置或数据移动减慢计算,其服务成本仍然很高。每一层的改进是叠加的,收益来自于路由优化(请求发送的位置)、调度(请求发送的时机)、内核(运行在GPU上的软件)、缓存(已保存并重用的工作)和模型实现(GPU代码的排序)。GPT-5.6 Sol在Codex中在所有这些优化中发挥了重要作用。
第一个重要例子是负载均衡。从全球范围来看,我们根据地理位置、可用容量和加速器类型(运行模型的GPU或专用芯片类型)路由请求。在一个集群内,我们根据负载、上下文长度、缓存可用性和其他请求属性在模型实例之间分配工作。在每个实例内,工作必须在加速器、模型的子网络和计算核心之间高效地划分。GPT-5.6 Sol在Codex中帮助我们分析生产流量、识别之前被忽视的失衡来源、测试新的路由策略,并不断调整这些启发式方法。仅仅依靠这些负载均衡的改进就大幅降低了我们模型的服务成本。
我们还使用GPT-5.6 Sol来优化模型的前向传播:将输入转换为下一个token预测的计算。即使单个操作运行很快,过多的内存移动、同步和低效的数据布局也可能导致GPU闲置。为避免这种情况,GPT-5.6 Sol找到了可以预计算、避免或并行化的工作。通过Codex,GPT-5.6 Sol自主重写并优化了我们的生产内核,这些内核是执行模型所需数学运算的核心代码。这部分工作得益于我们训练GPT-5.6在[Trizon](https://triton-lang.org/main/index.html)和[Gluon](https://triton-lang.org/main/gluon/index.html)这两种由OpenAI维护的开源GPU编程语言方面的有效性。这些努力再加上GPT-5.6 Sol带来的更广泛的内核进展,使得端到端服务成本降低了20%。我们还大力投资于验证工具,如开源工具[FpSan](https://triton-lang.org/main/programming-guide/chapter-3/fpsan.html)(浮点清理工具),以帮助验证GPT-5.6 Sol编写的内核的正确性。
推测解码是提高速度和效率的另一种手段。该技术涉及让一个更小的草稿(或称“推测器”)模型与主模型并行运行,为主模型提出多个token的提议。当这些提议被接受后,该系统可以从一个主模型的通过中生成多个输出token,从而减少昂贵的序列计算量。GPT-5.6 Sol通过设计并运行数百个实验来改进其草稿模型,测试规模、结构和特性的变化。此外,GPT-5.6 Sol启动并监控推测器的训练过程,自动干预问题的出现,包括硬件故障和训练不稳定。最终的改进使得token生成效率提高了15%。
在处理未缓存输入token时,模型在一次计算密集的过程中建立键值(KV)缓存;在生成输出时,它反复从该缓存中读取并扩展。然而,服务的最佳配置条件(如批处理、分片和KV管理)在很大程度上取决于工作负载——提示和输出的长度、批量大小、缓存命中率、查询特征等。然而,之前配置空间过于庞大,无法系统调优,迫使工程师依赖于广泛的启发式办法。借助GPT-5.6 Sol在Codex中,我们得以分析生产工作负载,生成并评估候选配置,并超优化引擎和模型在每种场景中的配置。这使得针对特定工作负载的新层次的优化变得可行,使得同样的硬件能够释放出更多有用的推理。
推理优化是一个持续的反馈循环。我们测量生产行为,识别最大的差距,实施变更,并验证这些变更能够改善整个系统,而不是孤立基准。GPT-5.6 Sol和Codex加速了这一循环的每个部分。这使得我们的团队能够探索更多的想法,更快地响应变化的工作负载,并为用户创造一个延迟更低、容量更多且成本更低的推理堆栈。
### 我们的智能代理工具如何简化重复工作
ChatGPT Work和Codex通过一系列模型请求和工具调用来完成复杂任务。在单次交互中——从用户请求到最终响应,Codex可能需要检查源代码、查询部署历史、阅读事件报告、编辑文件和运行测试。每个步骤都可能需要一个请求。
准备上下文、传输数据、运行推理、调用工具和启动进程都需要时间和计算。如果一个任务需要30次模型请求,每多一秒就会累积。因此,提升整体性能意味着需要减少整个系统中的重复工作,而不仅仅是让模型运行得更快。

这些乘数影响了我们智能代理工具的设计,这是一个Rust编排层,连接我们的模型、工具和用户环境。接下来,我们将讨论如何避免上下文膨胀、加载工具和重用工作,提高每个请求的效率。
#### 避免上下文膨胀
随着代理获得更多工具、技能、插件和对话历史,上下文窗口会很容易扩展。这增加了成本,干扰模型,并促使不必要的推理。该工具通过延迟发现减少了这些开销,意味着集成、自定义MCP工具、技能和插件仅在需要时才会出现。该工具还可以防止个别工具和MCP集成意外消耗上下文窗口。工具输出默认限制为10,000个token,除非模型请求不同的限制。
#### 为提示缓存保留精确的前缀
正如之前提到的,代理循环可能会在单次交互中多次将相同的指令、对话历史、工具定义和早期结果发送到GPU。处理这些重复输入的成本很高,因此提示缓存重用了与之前处理的提示前缀相关的计算。为了保留该前缀,该工具将所有模型可见的历史视作仅附加的:新的消息、工具结果和环境更新只是附加到末尾,而不是插入到更早的上下文中。工具按确定性顺序呈现,而运行时设置(如审批政策)在执行时应用,而不是嵌入到工具定义中。这种设计选择有利于Codex和ChatGPT Work的总体高提示缓存命中率。

### 效率在智能曲线上的体现
我们通过GPT-5.6提供的效率提升,源于多年在整个堆栈中的复合改进,涵盖研究、推理和我们的智能代理工具。GPT-5.6在实现这些改进中的作用让我们对优化的加速进程感到乐观。我们将继续在内核优化等领域进行更多重大优化,同时在我们堆栈中进行基础改进。我们期待将这些持续、隐秘的改进以更广泛可用和高性价比的智能形式回馈给我们的用户和客户。
*特别感谢Matthew Ferrari、Philippe Tillet、Ahmed Ibrahim、Joe Gershenson和Steve Coffey,技术团队成员,感谢他们对本帖的贡献。*
---
原文链接:[点击查看](https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency)
我们设计了GPT-5.6模型系列,旨在平衡[能力与成本](https://openai.com/index/gpt-5-6/),以应对人们使用我们模型时面临的任务需求。我们的旗舰模型GPT-5.6 Sol,以最强的推理能力在人工分析编码代理指数上以不到一半的成本超越了Claude Fable 5。Terra在智能基准上表现与GPT-5.5相当,但价格仅为后者的一半,而Luna是我们最快、最具性价比的模型,其价格比Sol低80%。为了实现这些效率,我们的研究和技术团队在每个主要层面上进行了重要优化。这些改进覆盖了我们的模型、推理(我们如何运行模型以生成输出)以及同时被Codex和ChatGPT Work使用的智能代理工具。
随着我们在过去四年中将模型规模扩展到10亿活跃用户和超过200万个企业,效率一直是将智能收益分配给每个人的核心。我们的使命是确保人工通用智能惠及全人类。在这些年里,我们不断致力于在整个技术堆栈中解锁更多优化,力求在每一点成本-智能曲线上提供最具性能的模型。通过GPT-5.6,我们达到了迄今为止最大的每个token智能效率,其训练目标是[每个token完成更多工作](https://openai.com/index/gpt-5-6/)。在训练过程中,我们同时优化任务成功率和效率,使模型能够更直接地完成任务。
这篇文章超越了我们的模型,分享我们在技术堆栈中的两个主要部分如何通过进步来提升效率,包括1)**推理**,通过优化负载均衡、推测解码、缓存和内核优化等过程,利用相同硬件获得更多输出,以及2)我们的**智能代理工具**,更好地管理上下文膨胀、工具使用和重复工作。我们还将分享GPT-5.6 Sol在自主实现这些增益中的作用。尽管任何单一的改进看似有限,但这些增益的叠加使我们能够在智能与效率的前沿交付方案。

### 使用GPT-5.6 Sol加速推理
在计算受限的世界中,模型需求增长速度快于计算能力,效率是每个系统设计的核心。特别是在我们的推理堆栈中,该堆栈运行经过训练的模型以生成响应。我们的主要目标是在保持用户期望的智能、延迟、可用性和可靠性的同时,为相同的硬件服务更多token。
要实现这一目标,需要优化整个系统。一个模型在孤立状态下可能高效,但如果请求分布不合理、硬件闲置或数据移动减慢计算,其服务成本仍然很高。每一层的改进是叠加的,收益来自于路由优化(请求发送的位置)、调度(请求发送的时机)、内核(运行在GPU上的软件)、缓存(已保存并重用的工作)和模型实现(GPU代码的排序)。GPT-5.6 Sol在Codex中在所有这些优化中发挥了重要作用。
第一个重要例子是负载均衡。从全球范围来看,我们根据地理位置、可用容量和加速器类型(运行模型的GPU或专用芯片类型)路由请求。在一个集群内,我们根据负载、上下文长度、缓存可用性和其他请求属性在模型实例之间分配工作。在每个实例内,工作必须在加速器、模型的子网络和计算核心之间高效地划分。GPT-5.6 Sol在Codex中帮助我们分析生产流量、识别之前被忽视的失衡来源、测试新的路由策略,并不断调整这些启发式方法。仅仅依靠这些负载均衡的改进就大幅降低了我们模型的服务成本。
我们还使用GPT-5.6 Sol来优化模型的前向传播:将输入转换为下一个token预测的计算。即使单个操作运行很快,过多的内存移动、同步和低效的数据布局也可能导致GPU闲置。为避免这种情况,GPT-5.6 Sol找到了可以预计算、避免或并行化的工作。通过Codex,GPT-5.6 Sol自主重写并优化了我们的生产内核,这些内核是执行模型所需数学运算的核心代码。这部分工作得益于我们训练GPT-5.6在[Trizon](https://triton-lang.org/main/index.html)和[Gluon](https://triton-lang.org/main/gluon/index.html)这两种由OpenAI维护的开源GPU编程语言方面的有效性。这些努力再加上GPT-5.6 Sol带来的更广泛的内核进展,使得端到端服务成本降低了20%。我们还大力投资于验证工具,如开源工具[FpSan](https://triton-lang.org/main/programming-guide/chapter-3/fpsan.html)(浮点清理工具),以帮助验证GPT-5.6 Sol编写的内核的正确性。
推测解码是提高速度和效率的另一种手段。该技术涉及让一个更小的草稿(或称“推测器”)模型与主模型并行运行,为主模型提出多个token的提议。当这些提议被接受后,该系统可以从一个主模型的通过中生成多个输出token,从而减少昂贵的序列计算量。GPT-5.6 Sol通过设计并运行数百个实验来改进其草稿模型,测试规模、结构和特性的变化。此外,GPT-5.6 Sol启动并监控推测器的训练过程,自动干预问题的出现,包括硬件故障和训练不稳定。最终的改进使得token生成效率提高了15%。
在处理未缓存输入token时,模型在一次计算密集的过程中建立键值(KV)缓存;在生成输出时,它反复从该缓存中读取并扩展。然而,服务的最佳配置条件(如批处理、分片和KV管理)在很大程度上取决于工作负载——提示和输出的长度、批量大小、缓存命中率、查询特征等。然而,之前配置空间过于庞大,无法系统调优,迫使工程师依赖于广泛的启发式办法。借助GPT-5.6 Sol在Codex中,我们得以分析生产工作负载,生成并评估候选配置,并超优化引擎和模型在每种场景中的配置。这使得针对特定工作负载的新层次的优化变得可行,使得同样的硬件能够释放出更多有用的推理。
推理优化是一个持续的反馈循环。我们测量生产行为,识别最大的差距,实施变更,并验证这些变更能够改善整个系统,而不是孤立基准。GPT-5.6 Sol和Codex加速了这一循环的每个部分。这使得我们的团队能够探索更多的想法,更快地响应变化的工作负载,并为用户创造一个延迟更低、容量更多且成本更低的推理堆栈。
### 我们的智能代理工具如何简化重复工作
ChatGPT Work和Codex通过一系列模型请求和工具调用来完成复杂任务。在单次交互中——从用户请求到最终响应,Codex可能需要检查源代码、查询部署历史、阅读事件报告、编辑文件和运行测试。每个步骤都可能需要一个请求。
准备上下文、传输数据、运行推理、调用工具和启动进程都需要时间和计算。如果一个任务需要30次模型请求,每多一秒就会累积。因此,提升整体性能意味着需要减少整个系统中的重复工作,而不仅仅是让模型运行得更快。

这些乘数影响了我们智能代理工具的设计,这是一个Rust编排层,连接我们的模型、工具和用户环境。接下来,我们将讨论如何避免上下文膨胀、加载工具和重用工作,提高每个请求的效率。
#### 避免上下文膨胀
随着代理获得更多工具、技能、插件和对话历史,上下文窗口会很容易扩展。这增加了成本,干扰模型,并促使不必要的推理。该工具通过延迟发现减少了这些开销,意味着集成、自定义MCP工具、技能和插件仅在需要时才会出现。该工具还可以防止个别工具和MCP集成意外消耗上下文窗口。工具输出默认限制为10,000个token,除非模型请求不同的限制。
#### 为提示缓存保留精确的前缀
正如之前提到的,代理循环可能会在单次交互中多次将相同的指令、对话历史、工具定义和早期结果发送到GPU。处理这些重复输入的成本很高,因此提示缓存重用了与之前处理的提示前缀相关的计算。为了保留该前缀,该工具将所有模型可见的历史视作仅附加的:新的消息、工具结果和环境更新只是附加到末尾,而不是插入到更早的上下文中。工具按确定性顺序呈现,而运行时设置(如审批政策)在执行时应用,而不是嵌入到工具定义中。这种设计选择有利于Codex和ChatGPT Work的总体高提示缓存命中率。

### 效率在智能曲线上的体现
我们通过GPT-5.6提供的效率提升,源于多年在整个堆栈中的复合改进,涵盖研究、推理和我们的智能代理工具。GPT-5.6在实现这些改进中的作用让我们对优化的加速进程感到乐观。我们将继续在内核优化等领域进行更多重大优化,同时在我们堆栈中进行基础改进。我们期待将这些持续、隐秘的改进以更广泛可用和高性价比的智能形式回馈给我们的用户和客户。
*特别感谢Matthew Ferrari、Philippe Tillet、Ahmed Ibrahim、Joe Gershenson和Steve Coffey,技术团队成员,感谢他们对本帖的贡献。*
---
原文链接:[点击查看](https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency)
评论
暂无评论。