人工智能时代的评分卡

发布于

人工智能时代的评分卡 | OpenAI

人工智能时代的评分卡
==========================

我常常听到首席财务官问的一个简单问题:我们如何从人工智能投资中获得更多价值?

多年来,市场通过采用情况来衡量软件的成功:购买的座位数、活跃用户数、更新的许可证。理解人工智能的价值需要更强有力的衡量标准:完成的工作。

面对的基本经济问题是,人工智能完成工作的价值是否增长得比生产这些工作的成本更快?

回答这个问题需要深入分析,而不仅仅是考虑每个令牌的成本。一个低成本的模型可能有更便宜的令牌,但获得良好的结果可能需要更多的尝试、更多的时间或更多的人类审查。一个更强大的模型可能有更昂贵的令牌,但可以一次性完成相同的任务。重要的是成功结果的全部生产成本,与该结果所创造的价值相比。

人工智能时代的最终评分卡可以视为“每美元的有用智能”。这个指标回答了四个关键问题:
1. 人工智能是否完成了重要的工作?
2. 每个成功任务的成本是多少?
3. 人们是否可以依赖结果?
4. 随着使用量的增长,每个人工智能美元是否产生更多价值?

1\. 有多少有用的工作完成?
-----------------------------------
从工作本身开始。

人工智能帮助解决了多少客户问题?帮助发出了多少代码变更?审核了多少合同?为人们节省了多少时间?因为在关键时刻提供了正确的上下文,改善了多少决策?

令牌在转化为人们可以使用的工作时创造价值。随着模型变得更强大,它们可以承担更长和更复杂的任务:维持上下文、经历多个步骤的推理、跨工具工作以及随时自我调整。

开始的最好方法就是选定一个工作流程。定义“完成”的意义,并在工作发生的系统中测量该结果。

对于支持团队,“完成”可能意味着解决客户问题。对于工程团队,则可能意味着通过测试的代码变更。对于法律团队,可能意味着准确按时审核合同。

考虑一个准备进行预测评审的财务团队。大部分工作发生在做出最终决定之前:查找最新的预测,将数据转移到Excel或Sheets,识别变更、对账、重建幻灯片,确保一切都准确无误。
ChatGPT可以负责大部分过程,让团队有更多时间关注重要的问题:有什么变化?为什么?我们接下来该做什么?

这就是每美元的有用智能的实际体现。更多的工作完成得更快,而人们则花费更多时间进行判断、创造和运用专业知识。

2\. 成功任务的实际成本是什么?
----------------------------------------------
下一个问题是,完成那项工作需要多少钱。

人工智能任务差异很大。快速的回答可能需要很少的计算量。而编码、研究或金融工作流程则可能涉及更深层次的推理、工具使用和多个操作。这些更复杂的任务可能需要更多的计算量,但它们也能创造更多的价值。

在模型级别,成功任务的成本取决于价格、使用的计算量以及达到正确结果的可能性。对于企业来说,完整成本还包括员工时间、人为审查、重试和返工。

计算很简单:
* 添加完成工作的全部成本。
* 计算达到所需质量标准的任务数量。
* 将投资总成本除以成功任务的数量。

这也是为什么每个令牌的最低价格并不总会产生最低的结果成本。即使是常规请求,前沿模型也许在一次性给出正确答案的情况下,能提供最佳价值,从而减少重试、延迟、审查和总体计算。

分级模型系列为客户提供了更多优化这个方程式的方式。我们上周发布的GPT-5.6有三个层级:Sol是我们的旗舰;Terra在性能和成本之间取得平衡;Luna是我们速度最快、最具性价比的模型。

这些层级提供了有用的起点。完整任务的经济学应该最终决定正确的模型。客户可能会在快速高容量工作流程中使用Luna,在需要更深层次的工作时使用Terra,或在较少尝试下能提供最佳结果时使用Sol。

我们训练的GPT-5.6旨在从每个令牌中获得更多的有用工作。在人工分析编码代理指数中,GPT-5.6 Sol在最大推理设置下以54%的较低输出令牌数量创下了新的行业标准。下方图表展示了比较结果。

***DeepSWE v1.1****: 长期工程任务;GPT‑5.6 Sol达到72.7%的新高,超过Claude Fable 5的69.9%,其估计的API成本低36.2%。*

在GPT‑5.6系列中,目标是一样的:每美元更成功的工作。更高的效率使现有任务更具经济性。更强的能力则使全新类型的工作成为可能。

每一代新模型都应该改善这个方程的两个方面。客户应该能够完成更多有价值的工作,同时每个任务的完成成本也在不断降低。

3\. 人工智能有多频繁地完成正确工作?
-----------------------------------------
第三个衡量标准是可靠性。

人工智能的采用通常是分阶段加深的。首先,人工智能帮助起草。然后,它会在工具和数据之间找到上下文并进行推理。随着时间的推移,它开始采取行动、处理例外和完成工作流程,而人们在需要时提供判断和控制。

每一步都创造了更多的价值,并对系统提出了更高的要求。

可靠性具有直接的经济价值。当结果准确、来源良好、一致并适时升级时,人们在审查、纠正和重复工作上花费的时间会更少。成功的任务成本更低,组织获得了在更重要的工作流程中使用人工智能的信心。

团队可以通过跟踪三个结果来使这一点变得具体:
* 可用:结果达到质量标准,如交付;
* 需要修正:结果需要另一次尝试或人工编辑;
* 需要升级:需要人为插手并完成工作。

这些指标展现的故事比模型精度本身更为丰富。它们展示了人工智能是否真正减少了完成项目所需的工作量。

可靠性还需要明确的边界。在人工智能从起草转换为采取行动之前,组织应明确:
* 系统可以访问哪些数据;
* 它可以使用或更改哪些系统;
* 何时需要人工审查或批准某项操作。

安全、隐私、合规性和控制构成了更深层使用的基础。人们需要理解系统的行为、数据的处理方式,以及其行为的治理方式。

ChatGPT Work建立在ChatGPT Enterprise的安全性、隐私、合规性和工作空间管理基础上。这允许组织赋予人工智能更多的上下文,并为更多有价值的工作流程提供更多访问权限,同时保持适当的监督。

能力赢得首次使用。可靠性使人工智能成为工作完成的一部分。

4\. 随着使用量的增长,每个人工智能美元能否购买更多工作?
-----------------------------------------------------
最后一个问题是,经济学是否在规模上有所改善。

公司可以通过随时间跟踪相同工作流程来衡量这一点。记录多少任务达到质量标准、完成它们的总成本以及每个成功任务的成本。如果完成的工作增长速度超过总成本,而质量保持或提高,则每个人工智能美元产生了更多的价值。

计算处于这个方程中心。

计算驱动着研究和人工智能完成的每项任务。它影响产品质量、速度、可靠性、可用性和成本。训练计算构建未来的能力。推理计算则今天提供有用的工作。这两者都应该转化为客户更好的结果。

更好的模型、更高效的推理、专用硬件、更高的利用率、更智能的路由和更强大的产品设计都改善了计算的回报。每一代基础设施都有助于训练更强大的模型。更好的算法、硬件和软件将更有效地服务这些模型。

客户用人类的方式体验这些改进:更好的答案、更快的结果、更少的修正、更可靠的产品,以及完成所需工作的成本降低。

增长是复合的。更好的基础设施加速研究。研究产生更强大和高效的模型。更强大的模型改善产品。更好的产品促进采用、学习和收入。这种增长支持对下一代研究、计算、部署和安全的持续投资。

OpenAI通过一个共享的智能平台将这些要素结合在一起。人们通过ChatGPT和ChatGPT Work使用它。开发者通过Codex和API构建它。企业将其部署到工作发生的系统中。

当一个层次改进时,每个产品和客户都可以受益。

人工智能时代的评分卡
--------------------------
综合来看,这四个指标告诉我们,每美元的有用智能是否在改善。

有用的工作告诉我们人工智能所产生的内容。成功任务的成本告诉我们实现该结果所需的条件。可靠性告诉我们人们可以自信地使用多少工作。规模的价值告诉我们每个美元和每个计算单位是否随着时间的推移而取得更多成就。

目标是让人工智能帮助人们完成更有意义的工作、做出更好的决策,并在其工作中花更多时间于需要独特人类判断和创造力的部分。

我们的任务是让这个公式在每一代中不断改善:更强大的模型、更快更可靠的结果,以及完成客户所需工作的成本更低。这就是人工智能如何随时间推移变得对更多人和组织更有用的方式。

* [2026](https://openai.com/news/?tags=2026)
* [企业](https://openai.com/news/?tags=enterprise)
* [GPT](https://openai.com/news/?tags=gpt)

作者
------
Sarah Friar

继续阅读
------------
[查看全部](https://openai.com/news/)

![HP早期AI胜利 — 卡片图片](https://images.ctfassets.net/kftzwdyauwt9/6phCuFzVSdCdVCh6YqXMa6/a4207917b5d7a43179a61f5de012168d/HP-1_1.png?w=3840&q=90&fm=webp) [如何在企业中扩大早期AI胜利公司 2026年6月28日](https://openai.com/index/hp-frontier-partnership/)

![代理如何变革工作 > 封面图片](https://images.ctfassets.net/kftzwdyauwt9/7hmtkjKv0DxS4Yt8mQZju2/c168bfa2010da64bcc9dd60d6b5491e8/Art_Card__1_.png?w=3840&q=90&fm=webp) [代理如何变革工作公司 2026年6月25日](https://openai.com/index/how-agents-are-transforming-work/)

![OpenAI与博通Jalapeño推理芯片卡片图片](https://images.ctfassets.net/kftzwdyauwt9/21KcazqOHUF7Cq71Hpfcnc/81ad98a1978845b441ab14e008168c75/openai-broadcom-jalapeno-inference-chip-image-1_1.png?w=3840&q=90&fm=webp) [OpenAI与博通发布针对LLM优化的推理芯片公司 2026年6月24日](https://openai.com/index/openai-broadcom-jalapeno-inference-chip/)

---

原文链接:[点击查看](https://openai.com/index/a-scorecard-for-the-ai-age)

评论

暂无评论。