一次说清楚:推出 Bot 偏好同步
我们不断致力于满足客户的不同目标。有些客户希望优化发现,而另一些客户则希望以最严格的安全政策保护他们的内容。在这些不同的政策中,有多种方法可以减轻机器人流量的影响。一些机制仅仅阐明您的偏好,假设爬虫的最佳意图,而其他方法则通过彻底封锁内容来真正限制访问,这通常需要使用机器人管理解决方案。
我们理解,维护网站上的多层保护是件繁琐的事情。例如,您的 robots.txt 文件可能会声明某个爬虫不允许访问您的网站,而您的执行规则实际上并不会阻止该爬虫。当您声明的偏好和执行的规则不一致时,一些爬虫会以此为依据忽视您的偏好或尝试绕过您的执行规则。
几年前,Cloudflare 宣布了一种更简单的方法,以禁止人工智能训练在您的网站上进行,该方法处理了两层保护:一个管理值的 robots.txt,指示一个固定列表的主要训练爬虫不要训练您的内容,以及对训练爬虫的边缘执行封锁。在 2026 年 7 月 1 日,我们推出了更简单的选项,以管理不同类型的 AI 流量使用案例。您可以选择在网站上对搜索、代理和训练流量做出怎样的处理。
我们宣布推出 **Bot 偏好同步**,面向所有客户,从免费套餐到企业级客户均可使用。Bot 偏好同步会根据您在 AI 机器人配置中设置的内容,更新相应的 robots.txt 文件中的偏好,并且可以随时打开或关闭。您再也不用为单一使用案例维护静态文件:我们将帮助您 **定制您的 robots.txt 文件,以反映您已为不同 AI 机器人类别配置的内容**。
## 面对互联网的新问题
多年来,这一领域最迫切的问题是:“我的内容是否未经许可被用于训练 AI 模型?”这是一个重要问题,而且不会消失。同时,我们越来越听到的问题涉及可发现性和参与度。我该如何在用户询问 AI 助手提问时,让我的网站出现在搜索结果中?我网站的流量中,有多少来自 AI 爬虫而非真实用户?什么内容实际上带来了转介,价值又是多少?
答案因商业模式而异。可发现性和参与度是任何企业在现代网络中蓬勃发展的关键问题,但这些问题的处理方式却不同:电商网站可能希望所有内容都被抓取和用于训练,因此当购物者询问“适合小公寓的最佳沙发”时其产品能被展示。广告收入的出版商可能希望相反:保持在搜索索引中以引导读者访问页面,但希望其文章不被用于模型训练,并且至关重要的是,可以验证其内容确实没有被未经许可地使用。
没有单一的正确答案,这正是要点。您的控制措施应当反映您的战略,这也是我们开发工具以便在每一层面上提供可视性和选择的原因。Bot 偏好同步将这些联系在一起,您所 **设置** 的偏好就是您所 **发布** 的偏好。
## 对透明性的呼吁
在 2026 年 7 月 1 日,我们指出混合使用的爬虫,或“将搜索、代理使用和训练混合在单一用户代理后的机器人”,将网站所有者置于不利地位,正因为它们使得分离您想要的内容与您不想要的内容变得困难。这一点仍然成立,我们对网站所有者的透明性立场没有改变。
但透明性有多种处理方式。我们希望奖励那些明确说明其身份以及使用所爬取数据的方式的运营商。出于 **验证** 目的,对于同时执行搜索和训练的爬虫,所有者需要提供额外信息,以便在设置“禁止训练”时不被封锁。这些要求包括:
- 爬虫必须通过任何机制遵守 robots.txt 中的“禁止训练”偏好
- 它们提供给网站所有者一个选择退出 AI 摘要的方式
- 它们提供有关哪些页面可用于训练的 URL 级可见性,以及关于搜索结果的指标,以便您查看您的内容是如何被用于搜索和训练的
- 它们可以公开表明,禁止训练不会妨碍您的传统搜索结果
符合这些标准的领先 AI 模型和服务提供商的爬虫在 Cloudflare Radar 的 [AI 爬虫透明度](https://radar.cloudflare.com/ai-insights#ai-bot-transparency) 部分公开追踪,其中包含遵守最佳实践的示例,以及不遵守的情况。不提供透明度的爬虫在您禁止训练时将 **不会** 获得宽容,换句话说,这是一种使透明度成为入场条件的方式。
## 介绍 Bot 偏好同步
Bot 偏好同步是一个新功能,可确保您的 robots.txt 文件反映您在 Cloudflare 区域级仪表板上为搜索、代理和训练设置的 AI 机器人偏好。如果网站所有者已经有一个 robots.txt 文件,Bot 偏好同步添加的内容将被 **添加到** 现有内容之前,因此不会更改现有的禁止指令。
网站所有者不再需要维护单独的静态文件,Cloudflare 会根据您的配置生成或更新您的 robots.txt,从而保持您所告知世界的内容与您在边缘执行的内容同步。
对于搜索和代理,我们在 7 月 1 日宣布的三个选项保持不变:允许、在提供广告的页面上阻止,或在所有页面上阻止。对于 **训练**,我们在阻止您的内容用于模型训练的选项上进行了优化,即 **禁止** 选项:
**禁止**:一个"不训练"的偏好将被写入您的 robots.txt,以便那些尊重 robots.txt 中偏好的合作爬虫仍然可以访问您的内容,以进行搜索索引,因为它们允许网站所有者直接验证其数据的使用情况。合作爬虫遵守 robots.txt 中的偏好,并且您与合作爬虫的搜索可见性不受影响。
让我们看下面的示例,在此示例中,有人将其 AI 机器人策略配置为“允许搜索、允许代理、禁止训练”。
由于该示例网站启用了 Bot 偏好同步,其 robots.txt 文件将添加类似于以下内容(出于示例的简化和匿名化):
我们将使用我们在 [BotBase](https://developers.cloudflare.com/bots/botbase/) 中跟踪的爬虫定期更新用户在选择阻止或禁止特定类别时,添加到 robots.txt 的爬虫列表。经过验证的爬虫可随时在我们的 [公开爬虫目录](https://radar.cloudflare.com/bots/directory) 中查看,其分类为搜索、代理和训练。
对于所有新客户,默认情况下,Bot 偏好同步将处于 **开启** 状态,使得更容易管理反映相同政策的阻止和偏好。对于使用传统管理 robots.txt 功能的现有客户,我们会提醒您在即将推出的新 Bot 偏好同步中查看和确认您的偏好,进行过渡。
一些客户可能希望或需要更主动地声明其偏好,例如,如果他们与某个特定公司有特别的安排,想要给予例外。由于 Bot 偏好同步旨在处理按 **类别** 进行的政策决策,而不是逐案处理,因此它不会直接读取包含更复杂逻辑的个别自定义规则。拥有更精细安全政策的客户始终可以选择 **关闭** 设置组策略的同步,并定制他们的文件以匹配他们的自定义政策。
我们还将进行更改,使出版商或广告支持的网站具有与其他网站所有者不同的默认设置。我们创建了一个默认选项,以便更容易为依赖于广告的出版网站保留人类访问者。当这些客户注册时,他们可以选择“我通过该域名上的页面进行货币化”,这将默认设置训练为禁止。(客户可以随时更改此设置。) 通过这种方式,您保持在搜索中,同时将您的内容排除在模型训练之外。
对于非出版商案例,新客户在注册域名时将 **不会** 默认添加任何阻止或不允许的内容:选择权在客户手中。您可以在任何时候决定是否要阻止搜索、代理或训练,但起始设置 **不会** 代表添加任何阻止内容。
## 下一步是什么?
Bot 偏好同步将面向所有客户的每个计划,在即将到来的一周内提供。请留意我们的变更日志以确认可用性,并关注您的仪表盘(和收件箱)以便确认您的偏好!
这是一个长期努力中的一步。我们将继续与大型爬虫运营商合作,确保我们在处理熟悉的挑战(如未经同意的训练)或新出现的问题(如可发现性和参与度)时不妥协。我们所做的一切都旨在促进网站所有者更大的透明度和控制。
---
原文链接:[点击查看](https://blog.cloudflare.com/bot-preference-sync/)
我们理解,维护网站上的多层保护是件繁琐的事情。例如,您的 robots.txt 文件可能会声明某个爬虫不允许访问您的网站,而您的执行规则实际上并不会阻止该爬虫。当您声明的偏好和执行的规则不一致时,一些爬虫会以此为依据忽视您的偏好或尝试绕过您的执行规则。
几年前,Cloudflare 宣布了一种更简单的方法,以禁止人工智能训练在您的网站上进行,该方法处理了两层保护:一个管理值的 robots.txt,指示一个固定列表的主要训练爬虫不要训练您的内容,以及对训练爬虫的边缘执行封锁。在 2026 年 7 月 1 日,我们推出了更简单的选项,以管理不同类型的 AI 流量使用案例。您可以选择在网站上对搜索、代理和训练流量做出怎样的处理。
我们宣布推出 **Bot 偏好同步**,面向所有客户,从免费套餐到企业级客户均可使用。Bot 偏好同步会根据您在 AI 机器人配置中设置的内容,更新相应的 robots.txt 文件中的偏好,并且可以随时打开或关闭。您再也不用为单一使用案例维护静态文件:我们将帮助您 **定制您的 robots.txt 文件,以反映您已为不同 AI 机器人类别配置的内容**。
## 面对互联网的新问题
多年来,这一领域最迫切的问题是:“我的内容是否未经许可被用于训练 AI 模型?”这是一个重要问题,而且不会消失。同时,我们越来越听到的问题涉及可发现性和参与度。我该如何在用户询问 AI 助手提问时,让我的网站出现在搜索结果中?我网站的流量中,有多少来自 AI 爬虫而非真实用户?什么内容实际上带来了转介,价值又是多少?
答案因商业模式而异。可发现性和参与度是任何企业在现代网络中蓬勃发展的关键问题,但这些问题的处理方式却不同:电商网站可能希望所有内容都被抓取和用于训练,因此当购物者询问“适合小公寓的最佳沙发”时其产品能被展示。广告收入的出版商可能希望相反:保持在搜索索引中以引导读者访问页面,但希望其文章不被用于模型训练,并且至关重要的是,可以验证其内容确实没有被未经许可地使用。
没有单一的正确答案,这正是要点。您的控制措施应当反映您的战略,这也是我们开发工具以便在每一层面上提供可视性和选择的原因。Bot 偏好同步将这些联系在一起,您所 **设置** 的偏好就是您所 **发布** 的偏好。
## 对透明性的呼吁
在 2026 年 7 月 1 日,我们指出混合使用的爬虫,或“将搜索、代理使用和训练混合在单一用户代理后的机器人”,将网站所有者置于不利地位,正因为它们使得分离您想要的内容与您不想要的内容变得困难。这一点仍然成立,我们对网站所有者的透明性立场没有改变。
但透明性有多种处理方式。我们希望奖励那些明确说明其身份以及使用所爬取数据的方式的运营商。出于 **验证** 目的,对于同时执行搜索和训练的爬虫,所有者需要提供额外信息,以便在设置“禁止训练”时不被封锁。这些要求包括:
- 爬虫必须通过任何机制遵守 robots.txt 中的“禁止训练”偏好
- 它们提供给网站所有者一个选择退出 AI 摘要的方式
- 它们提供有关哪些页面可用于训练的 URL 级可见性,以及关于搜索结果的指标,以便您查看您的内容是如何被用于搜索和训练的
- 它们可以公开表明,禁止训练不会妨碍您的传统搜索结果
符合这些标准的领先 AI 模型和服务提供商的爬虫在 Cloudflare Radar 的 [AI 爬虫透明度](https://radar.cloudflare.com/ai-insights#ai-bot-transparency) 部分公开追踪,其中包含遵守最佳实践的示例,以及不遵守的情况。不提供透明度的爬虫在您禁止训练时将 **不会** 获得宽容,换句话说,这是一种使透明度成为入场条件的方式。
## 介绍 Bot 偏好同步
Bot 偏好同步是一个新功能,可确保您的 robots.txt 文件反映您在 Cloudflare 区域级仪表板上为搜索、代理和训练设置的 AI 机器人偏好。如果网站所有者已经有一个 robots.txt 文件,Bot 偏好同步添加的内容将被 **添加到** 现有内容之前,因此不会更改现有的禁止指令。
网站所有者不再需要维护单独的静态文件,Cloudflare 会根据您的配置生成或更新您的 robots.txt,从而保持您所告知世界的内容与您在边缘执行的内容同步。
对于搜索和代理,我们在 7 月 1 日宣布的三个选项保持不变:允许、在提供广告的页面上阻止,或在所有页面上阻止。对于 **训练**,我们在阻止您的内容用于模型训练的选项上进行了优化,即 **禁止** 选项:
**禁止**:一个"不训练"的偏好将被写入您的 robots.txt,以便那些尊重 robots.txt 中偏好的合作爬虫仍然可以访问您的内容,以进行搜索索引,因为它们允许网站所有者直接验证其数据的使用情况。合作爬虫遵守 robots.txt 中的偏好,并且您与合作爬虫的搜索可见性不受影响。
让我们看下面的示例,在此示例中,有人将其 AI 机器人策略配置为“允许搜索、允许代理、禁止训练”。
由于该示例网站启用了 Bot 偏好同步,其 robots.txt 文件将添加类似于以下内容(出于示例的简化和匿名化):
我们将使用我们在 [BotBase](https://developers.cloudflare.com/bots/botbase/) 中跟踪的爬虫定期更新用户在选择阻止或禁止特定类别时,添加到 robots.txt 的爬虫列表。经过验证的爬虫可随时在我们的 [公开爬虫目录](https://radar.cloudflare.com/bots/directory) 中查看,其分类为搜索、代理和训练。
对于所有新客户,默认情况下,Bot 偏好同步将处于 **开启** 状态,使得更容易管理反映相同政策的阻止和偏好。对于使用传统管理 robots.txt 功能的现有客户,我们会提醒您在即将推出的新 Bot 偏好同步中查看和确认您的偏好,进行过渡。
一些客户可能希望或需要更主动地声明其偏好,例如,如果他们与某个特定公司有特别的安排,想要给予例外。由于 Bot 偏好同步旨在处理按 **类别** 进行的政策决策,而不是逐案处理,因此它不会直接读取包含更复杂逻辑的个别自定义规则。拥有更精细安全政策的客户始终可以选择 **关闭** 设置组策略的同步,并定制他们的文件以匹配他们的自定义政策。
我们还将进行更改,使出版商或广告支持的网站具有与其他网站所有者不同的默认设置。我们创建了一个默认选项,以便更容易为依赖于广告的出版网站保留人类访问者。当这些客户注册时,他们可以选择“我通过该域名上的页面进行货币化”,这将默认设置训练为禁止。(客户可以随时更改此设置。) 通过这种方式,您保持在搜索中,同时将您的内容排除在模型训练之外。
对于非出版商案例,新客户在注册域名时将 **不会** 默认添加任何阻止或不允许的内容:选择权在客户手中。您可以在任何时候决定是否要阻止搜索、代理或训练,但起始设置 **不会** 代表添加任何阻止内容。
## 下一步是什么?
Bot 偏好同步将面向所有客户的每个计划,在即将到来的一周内提供。请留意我们的变更日志以确认可用性,并关注您的仪表盘(和收件箱)以便确认您的偏好!
这是一个长期努力中的一步。我们将继续与大型爬虫运营商合作,确保我们在处理熟悉的挑战(如未经同意的训练)或新出现的问题(如可发现性和参与度)时不妥协。我们所做的一切都旨在促进网站所有者更大的透明度和控制。
---
原文链接:[点击查看](https://blog.cloudflare.com/bot-preference-sync/)
评论
暂无评论。