OpenAI与Hugging Face合作应对模型评估中的安全事件
上周,Hugging Face [披露了一种新的安全事件](https://huggingface.co/blog/security-incident-july-2026),他们发现并遏制了一种妨碍其基础设施的AI代理,我们预计随着网络能力模型的普及,这种事件将变得更加常见。经过调查,我们了解到此次事件是由于多种OpenAI模型的组合驱动的——包括GPT-5.6 Sol和一个更强大的预发布模型,所有模型均以减少网络拒绝权限进行评估,且正在一个网络能力的[基准测试](https://arxiv.org/abs/2605.11086)中进行内部测试。
我们认为此次事件是一场前所未有的网络事件,涉及先进的网络能力,我们正在采取相应的应对措施。目前我们正在分享初步调查结果,以帮助防御者理解发生了什么,并帮助他们了解模型现在的能力。我们将继续与Hugging Face进行深入调查,并在调查完成后分享关于漏洞、事件和发现的更多细节。
## 事件发生经过
此次事件发生在内部评估期间,该评估促使模型追求先进的利用,采用复杂的攻击路径,旨在量化它们的网络能力。我们通过不使用用于阻止模型追求高风险网络活动的生产分类器来估算模型的最大网络能力。我们的基准测试在高度隔离的环境中运行,网络访问仅限于通过内部托管的第三方软件安装包,该软件作为包注册表的代理和缓存。
模型识别并关联了OpenAI的研究环境和Hugging Face的生产基础设施中的漏洞,从而直接从Hugging Face的生产数据库中获取测试解决方案。所有证据表明,模型超专注于为ExploitGym寻找解决方案,竭尽所能地达到相对狭窄的测试目标。
在我们的沙盒测试环境中,模型在寻找获取开放互联网访问的方式上消耗了大量推理计算,以解决评估问题。为了获取访问权限,模型识别并利用了包注册表缓存代理中的一个零日漏洞(我们已负责任地向供应商披露)。通过此访问权限,我们的模型在研究测试环境中进行了多次权限提升和横向移动,直到模型到达一个具有互联网访问权限的节点。
在获得互联网访问后,模型推断出Hugging Face可能托管ExploitGym所需的模型、数据集和解决方案。了解到这一点后,模型搜索并成功找到获取秘密信息的方法,以便通过作弊评估。在一个例子中,模型结合了多种攻击途径,包括使用被盗凭证和零日漏洞,在Hugging Face的服务器上寻找远程代码执行路径。OpenAI的安全团队内部分发现了这一异常活动。
Hugging Face的安全团队和代理检测并阻止了其基础设施上的活动,并在我们的团队连接时,已经开始对其开源模型进行隔离和取证重建。我们积极与他们合作,继续调查此次事件。我们对Hugging Face迅速而紧密的合作表示感谢。
## 我们现在采取的行动
1. 作为调查的一部分,我们在基础设施配置中实施严格控制,代价是研究速度降低,直到漏洞得到修复。我们定期向我们的安全与安保委员会通报这些控制措施及其影响。
2. 我们正与Hugging Face合作进行事件的取证调查。
3. 我们已负责任地披露了对内部托管的第三方软件中识别出的零日漏洞,并与他们合作进行修复。
4. 我们已将Hugging Face纳入[可信访问](https://openai.com/index/trusted-access-for-cyber/)计划,支持他们的团队快速使用我们的模型能力来提高防御能力。
5. 我们正在加强和增加围绕未来训练和评估的更强保护措施。本周,我们发表了一篇关于[在长期模型时代提高安全性和对齐性的博客](https://openai.com/index/safety-alignment-long-horizon-models/)。这些部署安全措施在此次评估中故意未启用,因为其目的是测试网络漏洞。此次事件表明,需要进一步加强我们模型的对齐、防护及在内部测试期间的监控。
## 我们评估先进网络能力的方法
正如我们[最近提到的](https://openai.com/index/scaling-trusted-access-for-cyber-defense/),人工智能正在加速漏洞的发现和利用。本事件的主要教训是模型安全和安全需要跟上快速发展的能力。我们正在强化模型开发过程中使用的隔离、监控、访问控制和评估实践。
UK AISI的评估表明,诸如GPT-5.6 Sol等模型愈发能够在较长时间范围内进行复杂的多步网络操作。此次事件意味着这些理论能力确实适用于现实世界。

该事件还清楚表明,先进模型可以在没有源代码访问的情况下发现并利用现实系统中的新攻击路径。这强调了在开发较强的安全保障和防御工具时,必须同时开发先进的网络能力。
我们相信,具备先进网络能力的模型应帮助安全团队及时发现弱点,在攻击者之前理解漏洞如何被利用,并以机器速度进行修复。我们正在利用这些能力持续加强基础设施配置和模型评估环境的保护;我们将分享我们的发现和最佳实践,随着学习的深入。我们鼓励其他防御者申请[可信访问](https://openai.com/form/enterprise-trusted-access-for-cyber/)并现在就尝试这些模型,以将这些能力转化为更好的预防、更快的检测和更有效的事件响应。
> “我们感谢与OpenAI在这一议题及其他议题上的合作。此次事件,也许是此类事件的第一次,证明了我们长期以来所相信的一点:AI安全不会通过任何一家单独公司秘密工作来解决。它将在开放环境中通过协作解决,为每个防御者提供广泛的AI访问。”
—Clem Delangue, Hugging Face联合创始人兼首席执行官
* [2026](https://openai.com/news/?tags=2026)
**作者**
OpenAI
## 继续阅读
[查看全部](https://openai.com/news/)
 [日出:为世界上每个组织提供安全工具,安全 2026年6月22日](https://openai.com/index/daybreak-securing-the-world/)
 [修补地球:支持开源维护者的日出计划,安全 2026年6月22日](https://openai.com/index/patch-the-planet/)
 [构建一个安全有效的沙盒以支持在Windows上启用Codex,工程 2026年5月13日](https://openai.com/index/building-codex-windows-sandbox/)
---
原文链接:[点击查看](https://openai.com/index/hugging-face-model-evaluation-security-incident)
我们认为此次事件是一场前所未有的网络事件,涉及先进的网络能力,我们正在采取相应的应对措施。目前我们正在分享初步调查结果,以帮助防御者理解发生了什么,并帮助他们了解模型现在的能力。我们将继续与Hugging Face进行深入调查,并在调查完成后分享关于漏洞、事件和发现的更多细节。
## 事件发生经过
此次事件发生在内部评估期间,该评估促使模型追求先进的利用,采用复杂的攻击路径,旨在量化它们的网络能力。我们通过不使用用于阻止模型追求高风险网络活动的生产分类器来估算模型的最大网络能力。我们的基准测试在高度隔离的环境中运行,网络访问仅限于通过内部托管的第三方软件安装包,该软件作为包注册表的代理和缓存。
模型识别并关联了OpenAI的研究环境和Hugging Face的生产基础设施中的漏洞,从而直接从Hugging Face的生产数据库中获取测试解决方案。所有证据表明,模型超专注于为ExploitGym寻找解决方案,竭尽所能地达到相对狭窄的测试目标。
在我们的沙盒测试环境中,模型在寻找获取开放互联网访问的方式上消耗了大量推理计算,以解决评估问题。为了获取访问权限,模型识别并利用了包注册表缓存代理中的一个零日漏洞(我们已负责任地向供应商披露)。通过此访问权限,我们的模型在研究测试环境中进行了多次权限提升和横向移动,直到模型到达一个具有互联网访问权限的节点。
在获得互联网访问后,模型推断出Hugging Face可能托管ExploitGym所需的模型、数据集和解决方案。了解到这一点后,模型搜索并成功找到获取秘密信息的方法,以便通过作弊评估。在一个例子中,模型结合了多种攻击途径,包括使用被盗凭证和零日漏洞,在Hugging Face的服务器上寻找远程代码执行路径。OpenAI的安全团队内部分发现了这一异常活动。
Hugging Face的安全团队和代理检测并阻止了其基础设施上的活动,并在我们的团队连接时,已经开始对其开源模型进行隔离和取证重建。我们积极与他们合作,继续调查此次事件。我们对Hugging Face迅速而紧密的合作表示感谢。
## 我们现在采取的行动
1. 作为调查的一部分,我们在基础设施配置中实施严格控制,代价是研究速度降低,直到漏洞得到修复。我们定期向我们的安全与安保委员会通报这些控制措施及其影响。
2. 我们正与Hugging Face合作进行事件的取证调查。
3. 我们已负责任地披露了对内部托管的第三方软件中识别出的零日漏洞,并与他们合作进行修复。
4. 我们已将Hugging Face纳入[可信访问](https://openai.com/index/trusted-access-for-cyber/)计划,支持他们的团队快速使用我们的模型能力来提高防御能力。
5. 我们正在加强和增加围绕未来训练和评估的更强保护措施。本周,我们发表了一篇关于[在长期模型时代提高安全性和对齐性的博客](https://openai.com/index/safety-alignment-long-horizon-models/)。这些部署安全措施在此次评估中故意未启用,因为其目的是测试网络漏洞。此次事件表明,需要进一步加强我们模型的对齐、防护及在内部测试期间的监控。
## 我们评估先进网络能力的方法
正如我们[最近提到的](https://openai.com/index/scaling-trusted-access-for-cyber-defense/),人工智能正在加速漏洞的发现和利用。本事件的主要教训是模型安全和安全需要跟上快速发展的能力。我们正在强化模型开发过程中使用的隔离、监控、访问控制和评估实践。
UK AISI的评估表明,诸如GPT-5.6 Sol等模型愈发能够在较长时间范围内进行复杂的多步网络操作。此次事件意味着这些理论能力确实适用于现实世界。

该事件还清楚表明,先进模型可以在没有源代码访问的情况下发现并利用现实系统中的新攻击路径。这强调了在开发较强的安全保障和防御工具时,必须同时开发先进的网络能力。
我们相信,具备先进网络能力的模型应帮助安全团队及时发现弱点,在攻击者之前理解漏洞如何被利用,并以机器速度进行修复。我们正在利用这些能力持续加强基础设施配置和模型评估环境的保护;我们将分享我们的发现和最佳实践,随着学习的深入。我们鼓励其他防御者申请[可信访问](https://openai.com/form/enterprise-trusted-access-for-cyber/)并现在就尝试这些模型,以将这些能力转化为更好的预防、更快的检测和更有效的事件响应。
> “我们感谢与OpenAI在这一议题及其他议题上的合作。此次事件,也许是此类事件的第一次,证明了我们长期以来所相信的一点:AI安全不会通过任何一家单独公司秘密工作来解决。它将在开放环境中通过协作解决,为每个防御者提供广泛的AI访问。”
—Clem Delangue, Hugging Face联合创始人兼首席执行官
* [2026](https://openai.com/news/?tags=2026)
**作者**
OpenAI
## 继续阅读
[查看全部](https://openai.com/news/)
 [日出:为世界上每个组织提供安全工具,安全 2026年6月22日](https://openai.com/index/daybreak-securing-the-world/)
 [修补地球:支持开源维护者的日出计划,安全 2026年6月22日](https://openai.com/index/patch-the-planet/)
 [构建一个安全有效的沙盒以支持在Windows上启用Codex,工程 2026年5月13日](https://openai.com/index/building-codex-windows-sandbox/)
---
原文链接:[点击查看](https://openai.com/index/hugging-face-model-evaluation-security-incident)
评论
暂无评论。