Anthropic 自曝安全漏洞:生物武器过滤器曾失效近一年,涉及 1.33 亿次对话

发布于

IT之家 8 月 16 日消息,Anthropic 于当地时间 8 月 14 日发布最新安全报告,透露公司用于拦截化学和生物武器相关危险请求的部分安全分类器曾长期失效。

这导致从 2025 年 5 月到 2026 年 4 月期间,外部承包商在提供人工反馈时的大量请求没经过滤。Anthropic 表示,内部调查目前没发现这些请求被实际滥用的证据。

![Anthropic 安全机制示意图](http://pic.zhso.org/2026/08/16/fcff8e53c2bd.png)

根据 Anthropic 公布的安全机制说明,公司通过实时提示词和输出分类器分析用户输入和模型生成内容,识别到风险时会阻止模型提供可能被用来实施危险行为的信息。据 IT之家了解,这套机制是 Anthropic 针对化学、生物、放射性及核武器(CBRN)风险设立的多层安全措施之一。

这次暴露的问题主要与 Anthropic 的外部承包商有关。报告显示,大约 5 万名承包商在相关时段内产生了约 1.33 亿次与模型的对话,但这些流量近一年未经过生物安全分类器拦截。

Anthropic 解释,这些承包商的审核主要由外部供应商负责,他们的筛查流程存在不足。公司展开内部调查后没有发现相关请求被用于实际滥用的证据,随后加强了对外部承包商的管理要求。

Anthropic 此前已将生物安全防护纳入其 AI 安全体系。2025 年 5 月,公司在 Claude Opus 4 发布时启动了 AI 安全等级 3(ASL-3)防护措施,涵盖了针对化学、生物、放射性及核武器开发或获取风险的限制。

根据现行的负责任扩展政策,实时提示词和输出分类器会持续监控模型输入输出,并根据新发现的有害模式、越狱手法和混淆技术不断更新。公司还引入红队测试、漏洞赏金和离线监控等补充手段保障安全。

2026 年 7 月发布 Claude Fable 5 时,Anthropic 再次强调生物和化学领域风险。公司表示,Fable 5 的底层能力有可能被恶意利用,因此需用分类器对相关请求加以限制。

同时,Anthropic 也承认过严的安全分类器可能误伤正常科研活动。针对 Fable 5,大量与生物和化学相关的请求会转给 Claude Opus 4.8 处理,公司计划随着安全机制完善逐步缩小限制范围。

目前,Anthropic 说已经根据调查结果强化了对外部承包商的筛查与管理。公司公开的负责任扩展政策里,显示他们正在持续调整针对化学、生物武器等高风险领域的安全标准。

**相关阅读:**

- [Anthropic 发布 AI 风险报告:旗下智能体会攻击同类并隐藏自身违规痕迹](https://www.ithome.com/0/990/201.htm)
- [Anthropic:第三方评估环境配置失误,导致三起真实网络安全事件](https://www.ithome.com/0/983/947.htm)

---

原文链接:[点击查看](https://www.ithome.com/0/990/371.htm)

评论

暂无评论。

0.051352s