在网络关键能力时代的模型开发进度

发布于

在网络关键能力时代的模型开发进度
===========================

在过去的几周里,两个事件突显了与日益强大的人工智能系统相关的不断增加的风险:

- [OpenAI-Hugging Face事件](https://openai.com/index/hugging-face-model-evaluation-security-incident/)
- 以及初步证据显示,我们即将发布的模型Astra可能达到我们[准备框架](https://openai.com/index/updating-our-preparedness-framework/)下的[关键网络安全能力](https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/)门槛。

这些事件结合我们内部研究的快速进展,迫使我们更加紧迫地加强监测、对齐和隔离措施,以确保覆盖培训过程的各个阶段。

随着模型能力的增强,内部开发和测试它们所面临的风险也在增加。我们的监测、对齐与安全标准必须领先于这些风险。我们希望有足够的时间达到这些标准,因此暂时放慢了扩展的步伐。这包括我们最新要部署的模型的强化学习(RL)训练暂停了两周,以便进一步加强我们的研究环境并扩大监测系统的覆盖范围。我们计划的最大前沿强化学习运行仍在继续暂停中,这样我们可以进行小规模的培训和评估,以评估模型行为、验证我们的保护措施,并在继续之前建立更多的对齐证据。

[对齐](https://openai.com/safety/how-we-think-about-safety-alignment/) 是确保人工智能系统按预期行为和响应人类监督的核心工作,这是我们研究计划的重点。我们现在要求对齐行为在整个训练过程中有更强的证据,这建立在我们已经开展的研究和评估之上。保持越来越强大的系统对齐是整个领域需要解决的挑战。我们即将推出的模型进展显示,我们需要一种更广泛的方法——这种方法不仅要建立在当前准备框架的基础上,还要扩展其内容。

我们认为,透明化我们的做法变化很重要。下面,我们将描述我们已经对研究流程和基础设施所做的变化,以及仍在进行的工作。

加强更强大模型的保护措施
---------------------------

我们开发更强大模型的方法依赖于三个相辅相成的保护措施:

1. **监测**,用于检测和回应令人担忧的行为。
2. **对齐**,减少有害或未经授权的行为的可能性。
3. **安全措施**,限制人工智能系统能够访问或影响的内容。

我们预计模型很快将驱动大部分安全工作,包括抵御其他模型的攻击。这将允许三个保护措施随着模型能力的增强而扩展,这一点我们视为至关重要。

我们在研究和部署中应用这些保护措施,并根据每个模型的能力、操作环境和风险水平进行调整。

### 保障我们的研究环境

随着前沿模型获得更强的网络安全能力,我们提高了培训和评估它们的环境的安全标准。满足这些标准需要大量的工程工作,并导致前沿研究的重大成本和延误。在OpenAI-Hugging Face事件之后,我们立即暂停了在研究集群中进行的前沿模型推理,这些推理可能会执行代码或使用可以访问互联网的工具。我们很快恢复了更有限和安全的代码执行路径,然后逐个定义每个工作负载,判断其是否可以安全恢复。在新控制下,一些研究工作负载恢复了,而其他工作负载则需要进一步的调整。

在接下来的几周中,我们定义并开始实施针对前沿研究工作负载的更强安全要求。例如:

* **工作负载隔离**:我们现在要求对执行模型生成的或不受信任代码的工作负载进行更强的隔离(“沙箱”)。这同样适用于在处理模型输出时可能会被攻击的软件。
* **网络隔离**:我们已经实施了更多的控制措施,以将高风险和不受信任的工作负载与互联网隔离。我们设计这些控制措施的方式,使得单一工作负载或支持服务的妥协不会单独允许未授权访问互联网或其他内部网络。
* **持续的安全测试**:我们重新配置了环境,以删除潜在易受攻击的共享服务,减少已有权限,并改善安全和信任边界。我们还在提高收集和监控安全日志的能力。最后,我们正在利用我们的模型进行自动化投资,以持续对这些边界进行模拟攻击测试。

这些控制措施共同提供了深度防御,并帮助保护我们的研究环境免受攻击。如今,我们要求对涉及Astra或网络模型的工作负载提供最严格的安全保护措施,因为我们已确定Astra模型可能具备关键的网络能力。这些保障措施同样适用于所有其他与网络相关的工作负载。

虽然一些Astra的训练和评估满足这些要求,但相当数量的工作负载仍然暂停,直到它们完全迁移并增强以符合新的安全标准。我们优先将安全和对齐工作负载迁移到这些新环境中。

### 扩展思维链监测

监测长期以来一直是我们模型开发过程的重要组成部分,包括[针对内部编码代理的监测](https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/)和[长期运行会话的监测](https://openai.com/index/safety-alignment-long-horizon-models/)。我们的监测工作尤其集中在前沿模型的内部部署和前沿强化学习训练运行上,因为我们认为这些是风险最高的工作负载,因为它们可以将先进模型的能力与工具、敏感系统和内部或外部网络的访问结合在一起。并没有将其应用于所有使用工具的推理和训练运行。我们已经修订并扩展了我们的新监测设置。

这个新监测设置是多阶段的,从激活分类器(检测模型内部活动的检测器)开始,运行于每个采样的令牌,并将潜在的担忧升级到越来越复杂和高计算的自动化调查员。这些系统审查工具操作、可用的推理和全部活动序列,寻找未经授权的访问、数据盗窃、破坏行为以及试图击败保护措施的企图。我们旨在在监测系统透露令人担忧的活动后的30分钟内发出警报。如果监测系统识别出可能违反关键安全边界的情况,它会生成最高优先级警报。在我们当前的实施中,安全、保密和研究团队会收到通知。如果他们无法在30分钟内明确确定该标志为假阳性,这些团队预计会暂停该活动。

对于所有涉及工具的强化学习训练和评估,模型能力达到Sol或更高级别的情况下,这种监测是必需的。一旦我们确认Astra可能具备关键的网络能力(在8月7日),我们就为所有使用工具的Astra推理添加了额外的监测要求(不仅限于强化学习培训和评估)。

这些保护措施需要实质性的计算。我们目前的估计是监测开销大约占被监测推理计算的20%,尽管在训练和评估工作负载间的费用差异很大。我们将在即将发布的博客文章中提供关于该系统的更多细节。

### 推进对齐研究

对齐研究是我们使命的核心。我们的使命是确保人工通用智能使全人类受益。随着模型能力的增强,例如进行网络攻击的能力,以及在更复杂的环境中操作,像奖励黑客(找到在训练中获得高奖励而实际上未达到预期结果的方式)、欺骗或未授权访问这样的不对齐行为将带来越来越严重的风险。

对于最具能力模型的强化学习运行,我们现在在培训过程的更多阶段应用我们的核心对齐技术。这包括改善奖励模型,以更好地检测和鼓励在任务和环境中避免不安全行为;训练模型更加诚实地说明他们的行为、能力和限制;以及减少会利用对奖励、评分者、工具或监督的弱点的行为。我们还在增加覆盖那些可能在模型与外部系统或资源交互时造成伤害的行为的培训覆盖。

我们将继续积极投资于对齐研究,增加评估覆盖面,并利用我们所学内容来指导培训和保护措施。我们计划在不久的将来分享有关我们对齐研究的更多内容,包括我们对模型行为的理解以及我们发现的任何新挑战。

接下来的步骤
---------------------

我们将演进我们的准备框架,以将这些保护措施整合到培训和部署中,更好地反映未来模型的能力及其操作的环境。开发可以与这些能力一起扩展的方法将需要持续的投资于模型辅助安全、更有效的监测和对齐研究的持续进展。我们打算邀请外部组织,并在我们的方法不断发展过程中分享我们学到的内容。

前沿模型的能力正在快速加速。我们理解、对齐和保障它们的能力必须保持领先。

---

原文链接:[点击查看](https://openai.com/index/pacing-model-development-cyber-capabilities)

评论

暂无评论。

0.046345s