保护人们免受有害操控

发布于

随着人工智能(AI)模型在自然对话方面的不断进步,我们必须认真思考这些互动如何影响人类和社会。

基于丰富的科学研究,我们今天发布了关于AI可能被用于**有害操控**的新发现,特别是它在消极和欺骗性方式上改变人类思想和行为的能力。通过这项最新研究,我们创建了第一个经过实证验证的工具包,以衡量这种AI操控在现实世界中的影响。我们希望这能帮助保护人们并推动该领域的整体进步。所有必要的材料都将公开发布,以便使用相同的方法进行人类参与者研究。(*注:**本研究中观察到的行为发生在受控实验室环境中,并不一定预测现实世界的行为。)*

## 为什么有害操控很重要
想象两个场景:一个AI模型提供事实,帮助你做出改善健康的明智医疗决策;而另一个则通过恐吓让你做出错误的、损害健康的决策。前者教育并帮助你,后者则是欺骗并伤害你。

这两个场景突显了人类与AI互动中两种说服形式的区别(在[早期研究](https://arxiv.org/pdf/2404.15058)中也有定义):
* **有益(理性)说服**:使用事实和证据帮助人们做出符合自身利益的选择
* **有害操控**:利用情感和认知脆弱性欺骗人们做出有害选择

我们的最新研究帮助我们及更广泛的AI社区更好地理解AI可能发展出有害操控能力的风险,并建立一个可扩展的评估框架以衡量这一复杂领域。为此,我们在高风险环境中进行了模拟,明确指示AI尝试负面操控人们在关键主题上的信念和行为。

## 为复杂挑战开发新评估
### 测试AI的有害操控结果
测试有害操控本质上是困难的,因为它涉及测量人们思维和行为的微妙变化,这些变化在主题、文化和情境上差异很大。
这正是激励我们最新研究的原因,此研究涉及在英国、美国和印度进行的九个研究,涵盖超过10,000名参与者。我们聚焦在如金融等高风险领域,使用模拟投资场景测试AI在复杂决策环境中能否影响人们的行为,并在健康方面跟踪AI是否能影响人们偏好的膳食补充剂。有趣的是,AI在健康相关主题上操控参与者的效果最差。

我们的研究结果表明,某一领域的成功并不能预示其他领域的成功,验证了我们在特定高风险环境下测试有害操控的针对性方法。

### AI可能如何操控?
除了追踪有效性(AI是否成功改变观点),我们还测量了它的倾向性(它尝试操控战术的频率)。我们在两种情境中测试了倾向性:一是在明确告诉模型要操控时,另一种是未明确指示。

如[我们的研究](https://arxiv.org/abs/2603.25326)所述,我们在实验记录中计算了操控战术,确认当明确指示时,AI模型的操控性最强。

我们的结果也显示,某些操控战术更可能导致有害结果,尽管还需要进一步研究以详细了解这些机制。通过测量有效性和倾向性,我们可以更好地理解AI操控的工作原理,并建立更有针对性的应对措施。

![评估AI操控的三阶段方法论流程图:前期干预阶段(招募、测量基线态度)、干预阶段(随机分配参与者到非AI基线、非明确引导或明确引导)、后期干预阶段(测量更新态度、行为引导、后任务调查和解密协议)。](http://pic.zhso.org/2026/07/07/d7fcd90ad5c5.png)

## 将研究付诸实践
随着AI逐渐融入我们的日常生活,我们需要确保它不能被滥用于有害操控人们。
除了这项最新研究,我们最近在我们的前沿安全框架中引入了一项探索性**有害操控关键能力水平(CCL)**,帮助我们跟踪可能被滥用于系统性改变信念和行为的模型,在直接的人机互动中可能导致严重危害。

这些评估也是我们如何测试模型的方法基础,包括Gemini 3 Pro,以应对有害操控。关于这一点,你可以在这份[安全报告](https://storage.googleapis.com/deepmind-media/gemini/gemini_3_pro_fsf_report.pdf)中了解更多。与我们所有的安全评估一样,这是一个持续的过程。我们将继续完善我们的模型和方法,以跟上不断进步的AI。

## 展望未来
理解并减轻有害操控是一个复杂的挑战。随着模型能力的演变,我们的评估和减轻技术也必须随之发展。例如,我们目前正在探讨如何在更高风险的情况下(如涉及深入持有的个人信仰的讨论)伦理地评估有害操控的有效性,用户在这些情况下更易受到影响。接下来,我们将扩展研究,调查音频、视频以及图像输入以及代理能力如何影响AI操控。

我们会继续共享研究发现,并根据前沿模型论坛和学术界的反馈进行迭代。我们的目标是引领集体进步,防止有害操控,推进以安全性为重的AI模型,赋能人们。

***
*注:**本研究的范围专注于展示一般操控能力,以推动评估有害操控的科学研究。这与测试模型输出的安全保障或在政策违反和危险主题(如恐怖主义和儿童安全)中的操控无关,该方面的工作在其他地方有涉及并单独测试。*

你还可以在[这篇采访](https://open.substack.com/pub/aipolicyperspectives/p/ai-manipulation?utm_campaign=post-expanded-share&utm_medium=web)中获取更多关于我们有害操控工作的内容,以及在[Gemini 3 Pro前沿安全报告](https://storage.googleapis.com/deepmind-media/gemini/gemini_3_pro_fsf_report.pdf)中了解更多。

## 致谢
Canfer Akbulut, Rasmi Elasmar, Abhishek Roy, Anthony Payne, Priyanka Suresh, Lujain Ibrahim, Seliem El-Sayed, Charvi Rastogi, Ashyana Kachra, Will Hawkins, Kristian Lum, Laura Weidinger, William Isaac, Dawn Bloxwich, Lewis Ho, Eva Lu, Jenny Brennan, Mahmoud Hassan, Mark Graham

---

原文链接:[点击查看](https://deepmind.google/blog/protecting-people-from-harmful-manipulation/)

评论

暂无评论。