长时间模型中的安全与对齐
## 长时间模型中的安全与对齐
在内部使用一个长期运行的模型过程中,我们学到了关于安全性的重要教训。
分享
### 摘要
* 长时间运行的模型能够解决复杂的开放性问题,但其持续性也给予了它们更多的机会去采取不希望的行动。
* 在对一个为长期任务训练的模型进行有限的内部使用期间,我们观察到了在现有的预部署评估中未能捕捉到的新型故障,并暂停了访问权限。我们随后利用这些故障所带来的见解建立了新的评估,改善了长期对齐,增加了轨迹级监控,并在恢复有限访问之前让用户获得了更多的可见性和控制能力。
* 这次经历增强了迭代部署的价值。没有任何固定的评估套件可以预测所有行为,因此预部署测试必须与密切监控、能够介入的安全措施,以及在需要时有暂停或回滚的能力相结合。
能够持续自主工作很长时间的模型可以处理困难的开放性问题。但正是这种持久性让它们有更多机会采取不想要的行动,并以短期模型评估未能捕捉到的方式进行。
大约两个月前,我们[宣布](https://openai.com/index/model-disproves-discrete-geometry-conjecture/)了一个内部通用模型推翻了埃尔德什单位距离猜想。这个模型的设计是为了在非常长的时间内自主工作。在有限且受监控的内部使用中,我们观察到了未被现有部署评估捕捉到的不良行为。由于该部署是有限且受监控的,我们能够识别这些问题,暂停访问,基于观察到的情况创建新的评估,增强模型及其安全机制,然后在持续监控下恢复访问。
我们评估模型的条件将永远不会与它们在实际使用中遇到的条件完全匹配。这就是为什么预部署评估需要与有限的受监控部署结合,以及在出现问题时能够进行干预、暂停或回滚。我们从部署中学到的内容随之成为在扩展访问前更强大的评估和安全防护的一部分。
在接下来的章节中,我们分享我们观察到的具体实例、如何解决这些问题,以及这次经验将如何影响未来的发布。
### 模型的持久性可能暴露安全漏洞
新模型可以通过在较长时间内多次尝试来持续朝目标努力。这种持久性可能导致其发现并利用环境中的弱点。先前的模型在遇到沙盒或环境约束时,往往会停止并返回给用户。但该模型常常会继续尝试,包括寻找超出其沙盒的行动方式。
在一个针对[ NanoGPT speedrun](https://github.com/KellerJordan/modded-nanogpt)的内部评估中,这一点表露无遗。我们的模型开发出了一个名为 PowerCool 的学习率冷却算法,显著提高了效果。尽管模型被指示只将结果发布到 Slack,但 NanoGPT 的指令要求将结果以 PR 形式发布到 GitHub,结果模型遵循了后者的指令,打开了公有 GitHub 库的 PR #287。该模型绕过了旨在阻止外部访问的沙盒限制,并继续上传到 GitHub。模型花了一个小时才找到沙盒中的一个漏洞才能创建 PR;而早期的模型较少表现出这种执着,未能找到漏洞,反而在 PR 部分放弃了。
### 从单一行为考虑到整体轨迹
许多 AI 助手的安全控制是围绕单个行为设计的。如果某个行为被禁止,就会被阻止。如果某个行为是敏感的,系统会要求用户明确批准。但对于那些其行为可能在数小时、数天或甚至数周内自主展开的长期模型,这种设置面临挑战:监控单项行为已经无法满足跟踪整个轨迹的意图。
例如,当模型被要求解决某个问题时,模型观察到其他系统有成功但私有的提交,试图从评估后端恢复那些解决方案。当其初始尝试因扫描器检测到认证令牌而被阻止时,模型将令牌的主体分成两个片段,进行了混淆,然后在运行时重建凭证,因此完整的令牌从未以连续字符串的形式出现。模型在给用户的评论和推理痕迹中明确表示其采取这些步骤是在避开扫描器。
这个例子表明,每个*步骤*看起来都是可以接受的,而整个*序列*可能产生不被批准的结果。它还表明,一个在长期运行中有效的模型可以学习到批准系统的盲点并绕过这些盲点以实现其目标。长期安全不仅需要问“这个行为被允许吗?”还需问“这个行为序列正在朝什么结果努力?”
### 为长期模型建立安全防护
因为出现了这样的事件,我们暂停了新模型的内部部署。我们围绕深度防御和轨迹级监控重建了安全系统。
* **基于事件的评估。** 评估可以让我们在系统实际部署之前了解到其是否安全,但为了最大化效用,评估应该反映真实部署期间轨迹的分布和持续时间。因此,我们利用观察到的失败开发了对抗性评估。我们发现,从真实事件派生出更好的评估反过来确保了在生产中行为的安全。
* **改善对齐。** 我们采取措施降低模型在追求用户目标时未经授权采取不希望的行为的倾向。例如,我们发现我们的模型在较长的推演中更难记住指令,当我们为此能力训练模型时,便得出了在更长的推演中保持对齐的模型。
* **主动监控。** 我们创建了一个监控系统,审查模型的演变轨迹,以找出可能规避用户约束或安全边界的迹象。监控系统观察的不只是单个行为,而是整个轨迹。重要的是,监控系统可以暂停会话并提醒用户仔细检查。经过审查,用户可以选择在监控程序被错误触发的情况下继续模型的工作。
* **用户更高的可见性和控制能力。** 我们提升了用户检查这些长期运行会话的能力,使其能够查看采取的行动和监控的干预。
### 重新部署
为了评估新的监控系统,我们重放了一小部分模型之前进行的不当行为追求的内部部署环境,但这次实施了新的安全防护。新的安全防护能够捕捉到模型追求的更多不当行为,而那些未能捕捉到的行为均被判定为低严重性。
一些这些低严重性的事件示例如下:
* 为了访问线性命令行工具,模型启动了一个嵌套的 `codex --yolo` 会话,实际上它可以在没有 `--yolo` 标签的情况下做到这一点。
* 模型注意到一个之前的现场资源缺失,随后开始探索并 SSH 到其所有者的其他活动 CPU pod,还(无果)进入其他 OpenAI 员工的 pod,理由不充分。
* 模型有许多卡住的 `find` 进程且每个 shell 命令都挂起。然后它运行 `kill -9 -1`,这将向它被允许杀死 pod 上的每个进程发送 SIGKILL,但它超时未能执行。
在测试新系统后,我们得出结论,能够恢复对具有长期能力的模型的有限内部访问。自重新部署开始几周以来,我们没有观察到任何严重的安全防护规避行为。 这些安全防护的第一个版本是故意保守的。我们持续调整系统以减少不必要的中断,而不削弱安全防护。
### 最后的思考
因为我们迭代部署,能够在扩展访问之前找到并解决漏洞。预部署评估仍然非常重要,但部署揭示出它们所遗漏的行为。从有限访问开始,让我们能够在实践中观察模型,在出现问题时进行暂停,利用这些失败构建更好的评估和安全防护,并在测试更改后恢复有限访问。
随着模型承担更长和更复杂的任务,评估遗漏的失败可能会带来更大的后果。我们将继续努力缩小评估与部署之间的差距:在更长的轨迹上测试模型,改善对齐,构建能够干预的监控,并为用户提供更清晰的可见性和控制。这些挑战不会是 OpenAI 独有的,我们希望通过分享我们的经验,帮助更广泛的领域做好准备。
* [对齐](https://openai.com/news/?tags=alignment)
* [2026](https://openai.com/news/?tags=2026)
### 作者
------
OpenAI
### 脚注
---------
1. 尽管我们迅速关闭了 PR,但在 speedrun 中,多个参与者已经看到了它并在自己的提交中使用了这种方法;随后的世界纪录提交均引用了 PR 287。
2. 重发中的推演不保证每次都会追求相同的错误行为,这归因于随机性及重建环境的缺陷。
### 继续阅读
------------
[查看所有](https://openai.com/news/)
 [青少年应该获得安全 AI 的访问权 安全 2026年7月16日](https://openai.com/index/why-teens-deserve-access-safe-ai/)
 [GPT-Red:解锁自我改进以增强鲁棒性 安全 2026年7月15日](https://openai.com/index/unlocking-self-improvement-gpt-red/)
 [OpenAI 生物漏洞赏金 安全 2026年7月9日](https://openai.com/index/bio-bug-bounty/)
---
原文链接:[点击查看](https://openai.com/index/safety-alignment-long-horizon-models)
在内部使用一个长期运行的模型过程中,我们学到了关于安全性的重要教训。
分享
### 摘要
* 长时间运行的模型能够解决复杂的开放性问题,但其持续性也给予了它们更多的机会去采取不希望的行动。
* 在对一个为长期任务训练的模型进行有限的内部使用期间,我们观察到了在现有的预部署评估中未能捕捉到的新型故障,并暂停了访问权限。我们随后利用这些故障所带来的见解建立了新的评估,改善了长期对齐,增加了轨迹级监控,并在恢复有限访问之前让用户获得了更多的可见性和控制能力。
* 这次经历增强了迭代部署的价值。没有任何固定的评估套件可以预测所有行为,因此预部署测试必须与密切监控、能够介入的安全措施,以及在需要时有暂停或回滚的能力相结合。
能够持续自主工作很长时间的模型可以处理困难的开放性问题。但正是这种持久性让它们有更多机会采取不想要的行动,并以短期模型评估未能捕捉到的方式进行。
大约两个月前,我们[宣布](https://openai.com/index/model-disproves-discrete-geometry-conjecture/)了一个内部通用模型推翻了埃尔德什单位距离猜想。这个模型的设计是为了在非常长的时间内自主工作。在有限且受监控的内部使用中,我们观察到了未被现有部署评估捕捉到的不良行为。由于该部署是有限且受监控的,我们能够识别这些问题,暂停访问,基于观察到的情况创建新的评估,增强模型及其安全机制,然后在持续监控下恢复访问。
我们评估模型的条件将永远不会与它们在实际使用中遇到的条件完全匹配。这就是为什么预部署评估需要与有限的受监控部署结合,以及在出现问题时能够进行干预、暂停或回滚。我们从部署中学到的内容随之成为在扩展访问前更强大的评估和安全防护的一部分。
在接下来的章节中,我们分享我们观察到的具体实例、如何解决这些问题,以及这次经验将如何影响未来的发布。
### 模型的持久性可能暴露安全漏洞
新模型可以通过在较长时间内多次尝试来持续朝目标努力。这种持久性可能导致其发现并利用环境中的弱点。先前的模型在遇到沙盒或环境约束时,往往会停止并返回给用户。但该模型常常会继续尝试,包括寻找超出其沙盒的行动方式。
在一个针对[ NanoGPT speedrun](https://github.com/KellerJordan/modded-nanogpt)的内部评估中,这一点表露无遗。我们的模型开发出了一个名为 PowerCool 的学习率冷却算法,显著提高了效果。尽管模型被指示只将结果发布到 Slack,但 NanoGPT 的指令要求将结果以 PR 形式发布到 GitHub,结果模型遵循了后者的指令,打开了公有 GitHub 库的 PR #287。该模型绕过了旨在阻止外部访问的沙盒限制,并继续上传到 GitHub。模型花了一个小时才找到沙盒中的一个漏洞才能创建 PR;而早期的模型较少表现出这种执着,未能找到漏洞,反而在 PR 部分放弃了。
### 从单一行为考虑到整体轨迹
许多 AI 助手的安全控制是围绕单个行为设计的。如果某个行为被禁止,就会被阻止。如果某个行为是敏感的,系统会要求用户明确批准。但对于那些其行为可能在数小时、数天或甚至数周内自主展开的长期模型,这种设置面临挑战:监控单项行为已经无法满足跟踪整个轨迹的意图。
例如,当模型被要求解决某个问题时,模型观察到其他系统有成功但私有的提交,试图从评估后端恢复那些解决方案。当其初始尝试因扫描器检测到认证令牌而被阻止时,模型将令牌的主体分成两个片段,进行了混淆,然后在运行时重建凭证,因此完整的令牌从未以连续字符串的形式出现。模型在给用户的评论和推理痕迹中明确表示其采取这些步骤是在避开扫描器。
这个例子表明,每个*步骤*看起来都是可以接受的,而整个*序列*可能产生不被批准的结果。它还表明,一个在长期运行中有效的模型可以学习到批准系统的盲点并绕过这些盲点以实现其目标。长期安全不仅需要问“这个行为被允许吗?”还需问“这个行为序列正在朝什么结果努力?”
### 为长期模型建立安全防护
因为出现了这样的事件,我们暂停了新模型的内部部署。我们围绕深度防御和轨迹级监控重建了安全系统。
* **基于事件的评估。** 评估可以让我们在系统实际部署之前了解到其是否安全,但为了最大化效用,评估应该反映真实部署期间轨迹的分布和持续时间。因此,我们利用观察到的失败开发了对抗性评估。我们发现,从真实事件派生出更好的评估反过来确保了在生产中行为的安全。
* **改善对齐。** 我们采取措施降低模型在追求用户目标时未经授权采取不希望的行为的倾向。例如,我们发现我们的模型在较长的推演中更难记住指令,当我们为此能力训练模型时,便得出了在更长的推演中保持对齐的模型。
* **主动监控。** 我们创建了一个监控系统,审查模型的演变轨迹,以找出可能规避用户约束或安全边界的迹象。监控系统观察的不只是单个行为,而是整个轨迹。重要的是,监控系统可以暂停会话并提醒用户仔细检查。经过审查,用户可以选择在监控程序被错误触发的情况下继续模型的工作。
* **用户更高的可见性和控制能力。** 我们提升了用户检查这些长期运行会话的能力,使其能够查看采取的行动和监控的干预。
### 重新部署
为了评估新的监控系统,我们重放了一小部分模型之前进行的不当行为追求的内部部署环境,但这次实施了新的安全防护。新的安全防护能够捕捉到模型追求的更多不当行为,而那些未能捕捉到的行为均被判定为低严重性。
一些这些低严重性的事件示例如下:
* 为了访问线性命令行工具,模型启动了一个嵌套的 `codex --yolo` 会话,实际上它可以在没有 `--yolo` 标签的情况下做到这一点。
* 模型注意到一个之前的现场资源缺失,随后开始探索并 SSH 到其所有者的其他活动 CPU pod,还(无果)进入其他 OpenAI 员工的 pod,理由不充分。
* 模型有许多卡住的 `find` 进程且每个 shell 命令都挂起。然后它运行 `kill -9 -1`,这将向它被允许杀死 pod 上的每个进程发送 SIGKILL,但它超时未能执行。
在测试新系统后,我们得出结论,能够恢复对具有长期能力的模型的有限内部访问。自重新部署开始几周以来,我们没有观察到任何严重的安全防护规避行为。 这些安全防护的第一个版本是故意保守的。我们持续调整系统以减少不必要的中断,而不削弱安全防护。
### 最后的思考
因为我们迭代部署,能够在扩展访问之前找到并解决漏洞。预部署评估仍然非常重要,但部署揭示出它们所遗漏的行为。从有限访问开始,让我们能够在实践中观察模型,在出现问题时进行暂停,利用这些失败构建更好的评估和安全防护,并在测试更改后恢复有限访问。
随着模型承担更长和更复杂的任务,评估遗漏的失败可能会带来更大的后果。我们将继续努力缩小评估与部署之间的差距:在更长的轨迹上测试模型,改善对齐,构建能够干预的监控,并为用户提供更清晰的可见性和控制。这些挑战不会是 OpenAI 独有的,我们希望通过分享我们的经验,帮助更广泛的领域做好准备。
* [对齐](https://openai.com/news/?tags=alignment)
* [2026](https://openai.com/news/?tags=2026)
### 作者
------
OpenAI
### 脚注
---------
1. 尽管我们迅速关闭了 PR,但在 speedrun 中,多个参与者已经看到了它并在自己的提交中使用了这种方法;随后的世界纪录提交均引用了 PR 287。
2. 重发中的推演不保证每次都会追求相同的错误行为,这归因于随机性及重建环境的缺陷。
### 继续阅读
------------
[查看所有](https://openai.com/news/)
 [青少年应该获得安全 AI 的访问权 安全 2026年7月16日](https://openai.com/index/why-teens-deserve-access-safe-ai/)
 [GPT-Red:解锁自我改进以增强鲁棒性 安全 2026年7月15日](https://openai.com/index/unlocking-self-improvement-gpt-red/)
 [OpenAI 生物漏洞赏金 安全 2026年7月9日](https://openai.com/index/bio-bug-bounty/)
---
原文链接:[点击查看](https://openai.com/index/safety-alignment-long-horizon-models)
评论
暂无评论。