预览 GPT-5.6 Sol:下一代模型

发布于

我们开始进行 GPT-5.6 系列的限量预览:Sol(我们的旗舰模型)、Terra(适合日常工作的平衡模型)和 Luna(快速且经济的模型)。Terra 的性能与 GPT-5.5 相当,但价格降低了 2 倍;Luna 则具备强大的能力且是最低成本的选择。

GPT-5.6 Sol 配备了我们迄今为止最稳固的安全机制。我们加强了针对高风险活动、敏感网络请求和重复滥用的保护机制,并花费数周时间寻找系统的弱点、压力测试和加强抵御现实攻击的能力。

我们相信广泛访问是至关重要的,计划在未来几周内将 GPT-5.6 Sol、Terra 和 Luna 一般性发布。作为与美国政府持续合作的一部分,我们在今天的发布前预览了计划及模型能力,并在他们的要求下,先为一小部分受信任的合作伙伴进行限制预览,待以后更广泛发布。在此期间,我们将继续与合作伙伴密切合作进行测试。

## 能力

GPT-5.6 Sol 是我们迄今为止最强大的模型。以下是模型在编码、生物学和网络安全方面能力改进的评估结果,同时我们还将在未来提供更详细的评估结果。我们也开启了新的 `max` 推理模式以使 Sol 有更多时间进行深入推理。

在编码工作流程中,GPT-5.6 Sol 在 **Terminal-Bench 2.1** 测试中设置了新的状态记录,测试要求规划、迭代和工具协作。

| 模型 | 分数 |
| ---- | ---- |
| GPT-5.6 Sol | 91.9% |
| GPT-5.6 Sol Ultra | 88.8% |
| GPT-5.6 Terra | 88.0% |
| GPT-5.6 Luna | 70.7% |

GPT-5.6 Sol 同样在生物学工作流程上表现出色。在 **GeneBench v1** 测试中,比 GPT-5.5 有更强的结果,并且使用了更少的token。

对于网络安全,GPT-5.6 Sol 成为我们最有能力的模型。它在长周期安全任务(包括漏洞研究和利用)中极大提高了性能效率。

## 更强的网络能力及更强的保障

我们开发的 GPT-5.6 Sol、Terra 和 Luna 配备了最稳固的保障,配置与每个模型的能力相匹配。随着模型能力的提高,我们逐步设计保障,以应对真实世界的对抗压力,同时保持对合法工作的访问。结合这些保障,GPT-5.6 Sol 更擅长帮助人们寻找和修复漏洞,而不是可靠地执行端到端攻击。

### 保障层次

我们在 GPT-5.6 预览中采用多层保障,配置因模型而异。通过训练模型拒绝禁止的网络协助,并根据生成实时评估输出来提供额外保护。所有的层叠措施共同提高了整体安全性,使得不良回应的可能性降低。

## 可用性与定价

在预览期间,GPT-5.6 模型将最初通过 API 和 Codex 向一小群受信任的伙伴和组织提供。我们计划很快将其更广泛地提供给使用 ChatGPT、Codex 和 API 的人们。

在此新命名系统中,数字标识模型的代次,而 Sol、Terra 和 Luna 则标识持久的能力层次,可以独立发展。GPT-5.6 的定价为每百万 token:Sol 为 $5 输入 / $30 输出;Terra 为 $2.50 输入 / $15 输出;Luna 为 $1 输入 / $6 输出。

我们在七月还将在 Cerebras 上推出 GPT-5.6 Sol,速度可达每秒 750 token,这将以空前的速度为客户提供最前沿的智能。我们期待通过这一预览期继续学习,并尽快将 GPT-5.6 Sol、Terra 和 Luna 推广给更多人。

---

原文链接:[点击查看](https://openai.com/index/previewing-gpt-5-6-sol)

评论

暂无评论。