内容独立日:AI流量管理新选项

发布于

一年前,我们宣布了第一个 [内容独立日](https://blog.cloudflare.com/content-independence-day-no-ai-crawl-without-compensation/),并为网站所有者提供了重新掌控其内容的手段。过去三十年来,爬虫与网站所有者之间的交易已不再适用——我们抓取你,你便获得流量推荐——而 AI 则在这一过程中趁虚而入,带走了内容,却未回馈任何价值,给网站所有者带来了生存威胁。因此,我们推出了一键 "阻止 AI 爬虫 " 的选项,以及一个 [按爬取付费的市场](https://blog.cloudflare.com/introducing-pay-per-crawl/)。

过去一年中,情况发生了剧变。去年七月,有关 "AI 爬虫 " 的讨论主要集中在没有回报的情况下阻止 AI 训练,强调这一交易是胜者与失败者之间的关系,内容被用作模型训练,却没有为网站所有者创造任何价值。但人们开始渴望更为细致的管理方法:内容所有者仍希望能够保护自己的内容,并且理应获得为创造、整理和分享这部分原创内容所付出的努力的补偿。同时,我们也意识到锁定内容并非通用解决方案;网站所有者希望可以有多种选择,而不仅仅是 "每次都阻止所有自动化"。

对于一些小型网站来说,问题不仅仅在于有人可能会使用你的内容进行模型训练——更在于没有人能够找到你。因此,你必须做出选择:要么在搜索中出现,让 AI 利用你,要么就面临失去可发现性的风险。这种行为不公平地优势了现有的搜索提供者,如果他们使用相同的爬虫进行搜索和训练,这种不公平的优势促使新的参与者在努力缩小竞争差距时变得更加隐秘。

### 现在,AI可以是任何东西

今天,AI 可以出现在任何地方。谷歌搜索已经从以 AI 排序转变为一个 [完整的答案引擎](https://blog.google/products-and-platforms/products/search/search-io-2026/),直接在结果页面上回答你的问题。而谷歌并不是唯一如此的公司——这就是 "搜索 " 当前的发展方向。

我们可能会辩论今天什么算作 "AI",然而标准明天就可能会改变。因此,我们更新的分类方法主要关注的是更深层次的问题:爬虫或代理的行为是什么?它们在我站点上做什么?它们存储了什么?以及它们将如何重新分享我的内容?

### 一个务实的分类法

为了应对这些问题,我们需要一个更为细致的分类法,符合客户关注的 AI 使用案例。因此,我们将讨论的范围扩展到超越 AI 训练,专注于三种我们希望所有客户都能进行管理的 AI 使用场景:
1. **搜索:**任何收集或索引你内容的行为,以便能够回答后续问题。重点在于,搜索主动构建了你网站的数据库,以便将来的查询能做出响应。网站所有者应期望因此获得流量推荐或其他合理补偿。
2. **代理:**通常是在实时情况下,代表用户执行某项操作的自动化行为。这包括聊天获取爬虫(例如 ChatGPT-User)和浏览器使用代理(例如驱动 Chrome 的 Gemini 或 Claude)。关键在于,它访问你的 Web 应用程序以完成工作,且通常有一个人正等待其完成。
3. **训练:**抓取你的内容以训练或微调模型。重点在于,你的数据永久吸收入 AI 的基础架构中,以提升其能力。

许多流行的网络爬虫属于上述某一分类,甚至可能同时属于多个。我们会将许多其他行为归入这三者之外的分类——包括广告验证、源获取和代理交易等(以下将详细说明)。我们相信,网站所有者应该能够轻松管理这三种以 AI 为中心的使用场景的访问权限。我们希望爬虫运营商能够将不同目的的爬虫进行区分,这将为网站所有者创造更多透明度,让他们更好地理解某个爬虫为何访问他们的站点,同时也能更好地管理给予该爬虫的访问权限。

### 管理AI流量的新选项

我们希望为 Cloudflare 网络上的所有网站所有者提供更多管理不同类型 AI 流量的选项。过去我们公布的"阻止 AI 爬虫 " 的管理预设包含了专为模型训练所设计的单一目的爬虫,但并非所有的 AI 使用情况都是相同的,我们希望我们的客户能够拥有必要的控制权。因此,我们将推出基于三种主要使用场景:搜索、代理和训练爬虫,来管理 AI 流量的能力。有了这些新选项,我们的客户可以更细致地调节管理 AI 爬虫流量,包括我们免费套餐的客户。

### 设定新的默认值

**在2026年9月15日,我们将为这三种分类设定新的默认值。** 对于所有新接入 Cloudflare 的域名,广告显示页面将默认阻止 "訓練 " 和 "代理 " 分类,而 "搜索 " 则仍然允许。

广告是网站所有者希望用户到达并观看的内容的信号——它是可以产生收入的,这推动了网站的业务。因此,在这些页面上,我们将人类注意力视为最终目标,并阻止可能阻止这种注意力的爬虫(即 "训练 " 和 "代理 " 爬虫)。另一方面,搜索是最自然的引导流量回访的行为,而我们认为大部分网站所有者允许这一点是有益的。

将于9月15日生效的另一项变化是,具有多重目的的爬虫(特别是那些结合搜索与训练的爬虫)将根据它们的所有行为进行允许或阻止,这与我们对网站所有者透明度的要求一致。由于默认值将根据最严格的适用规则来执行,像 Googlebot、Applebot 和 BingBot 这样的多功能爬虫将被选择阻止 "训练 " 的客户所阻挡(无论是通过新选项管理 AI 流量,还是通过传统的阻止 AI 爬虫服务)。

当然,客户的选择至关重要:如果网站所有者希望放弃这些新的默认配置,他们可以 [轻松在安全设置中标记这一点](https://dash.cloudflare.com/?to=/:account/:zone/security/settings) ,任何时候在9月15日之前确认他们希望对同时抓取搜索目的的训练爬虫保持"不变"。我们还将继续通知客户即将到来的默认设置变化,确保希望选择不同于默认值的客户有机会进行操作。

### BotBase:企业客户的新可见度平台

我们也很高兴推出一个重要的可见性更新,作为企业爬虫管理的新功能。随着 Cloudflare 追踪的爬虫目录不断增长,客户希望以合理的分组来管理这些爬虫,并了解特定爬虫的更多细节。

介绍我们的新数据库 [BotBase](https://developers.cloudflare.com/bots/botbase/)。BotBase 是我们新的已知爬虫及代理的追踪数据库,提供了一个全面的、可搜索的数据库,直接在 Cloudflare 控制面板上展示我们的所有爬虫目录。我们着眼于**可见度优先**,但在今年晚些时候,我们将扩展 BotBase,提供已知自动化内容的直接控制中心。

通过这个新的视图,企业爬虫管理客户可以查看所有已确认的爬虫和代理的完整目录,以及它们在更新的分类法中的分类——这是我们以前未曾在 Cloudflare 控制面板上动态展示过的视图。希望精确针对特定爬虫的客户还可以轻松过滤来自该爬虫的所有流量,并复制检测 ID 以用于安全规则。所有这些现在都在一个专用页面中,可以通过 [爬虫管理配置卡](https://dash.cloudflare.com/?to=/:account/:zone/security/settings/bot-traffic/bot-base) 访问。

当我们构建 BotBase 时,我们希望考虑所有能够帮助我们构建可扩展、强大的爬虫洞察的信息点。其中一个是我们更新分类法的基石,即基于爬虫在你网站上可能采取的行动——它的行为。我们将这些分类的标准化如下,每个爬虫都会根据一个或多个这些行为进行分类。

#### 爬虫分类
| 爬虫分类 | 行为和用途 |
| ----------- | ------------- |
| **搜索** | **扫描你网站的爬虫,以帮助其出现在搜索引擎结果中** |
| **代理** | **代表人类访问页面的用户导向代理** |
| **训练** | **抓取以训练或微调模型的爬虫** |
| 交易 | 代表用户的结账操作 |
| 数据收集 | 包括价格抓取、竞争情报收集和第三方分析 |
| 安全测试 | 包括漏洞扫描和渗透测试 |
| SEO | SEO 爬虫、网站审计、无障碍检查 |
| 广告验证 | 广告投放验证、广告欺诈检测 |
| 社交/链接预览 | 社交平台和消息应用的链接预览 |
| 源获取 | 包括 RSS 阅读器、播客聚合器和新闻源爬虫 |
| 监控和操作 | 包括正常运行时间监控、Webhook 和健康检查 |

### 爬虫如何使用我的内容?

我们听说另一个对客户非常重要的信息是爬虫的**内容使用**——在爬取您的内容后,爬虫可能保留和重新分享什么。这使我们构建出针对内容使用进行选择和阻止的能力,设置分为三种级别,从最少到最多宽容:
- `immediate`——交互,但不存储和重用任何内容
- `reference`(默认)——索引、摘录并链接回去
- `full`——总结和再现

这些值可以与爬虫分类结合,以表达细致的规则,例如 "允许用于 **搜索**、**SEO** 和 **广告验证** 的所有爬虫,但仅限于 `reference` 使用水平。这使得网站所有者能够以合理的分组方式作出决策,而不是一一管理每个爬虫的单独规则。

为进一步支持这一点,从今天开始,我们正在测试一种新的信号 `use`,它扩展了[内容信号](https://contentsignals.org/)并存在于你的 robots.txt 中。它将原版内容信号的三个字段扩展为第四个可选字段,以表达上述相同的偏好:
- `use=immediate`
- `use=reference`
- `use=full`

与 robots.txt 文件中列出的所有其他项一样,内容使用的值表示网站所有者的 **偏好**,而不是直接发出阻止请求。我们现在添加对这个扩展的支持:之前已经启用的受管 robots.txt 的所有客户——这些规则表明爬取搜索是可以的,但爬取训练是不可的——将会在其 robots.txt 额外添加 `use=reference` 偏好。

```
# Cloudflare 管理内容与原版内容信号
User-agent: *
Content-Signal: search=yes,ai-train=no
Allow: /
```

```
# Cloudflare 管理内容与新内容使用信号
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
```

我们还开始追踪 BotBase 中每个爬虫的内容使用情况,当我们发现某个爬虫滥用这些信号时,它将失去 "已验证 " 状态,结果将不再被允许。当前,完全再现的爬虫无法拥有已验证状态。

### 爬虫被验证是意味着什么?

谈到 "已验证",我们正在更新 [已验证爬虫](https://developers.cloudflare.com/bots/concepts/bot/verified-bots/) 的定义,以反映即将对默认允许和阻止基线进行的变化。以前,**所有** 已验证爬虫都默认被允许,这体现在我们基本的 [爬虫战斗模式](https://developers.cloudflare.com/bots/get-started/bot-fight-mode/) 提供的功能来阻止不必要的自动化流量,以及我们的企业爬虫管理客户的规则模板。

从今天开始,我们将此进行调整,以便增加细致性:未经验证的爬虫仍然会默认阻止,但我们不再将已验证视为 "默认允许"。现在,已验证标签使一个爬虫在其相关分类下可被允许,意味着 **允许的分类**(例如,允许搜索)将决定什么可以访问网站。

为平衡这一变化,我们将开放成为验证爬虫的过程,同时让其更为透明。要 "验证 " 一个爬虫,爬虫运营商需要展示两个方面:您诚实地代表自己,**和** 不滥用因诚实所获得的访问权限。为了便于爬虫运营商,我们目前正在构建管理工具,让他们更好地确保在 Cloudflare 的分类系统中的准确表现(将在不久的将来公布)。

### 实验性的信任转移

我们还要补充一点:在您门前的爬虫(或代理)并越来越多不是由构建它的公司运营。像 Cloudflare 的开发者平台这样的平台同时为成千上万的不同运营商运行自动化,从企业到你从未听说过的开发者。您可能信任 Stripe,但不一定信任每一个将 Stripe 的工具融入周末项目的每一个人。

我们将网站所有者 → 爬虫拥有公司 → 最终用户的情况称为 **信任转移**,并我们建议利用现有的**转发头**,正如 [RFC 7239](https://www.rfc-editor.org/info/rfc7239) 的定义,让请求的“代理组件披露在代理过程中丢失的信息”。

这类似于 `X-Forwarded-For` 对 IP 地址的作用,或 `X-Forwarded-Host` 保留原始 Host 头。 因此,当网站所有者说 "允许这个运营商 " 时,这一偏好将保持作用,无论该运营商是直接找你还是通过三个层次的可信中介来到你身边。更多细节可以在我们的 [文档](https://developers.cloudflare.com/bots/reference/bot-verification/web-bot-auth/) 中找到,以下是格式的简要示例:
```
Forwarded: for="openai"
```

如果将上面讨论的内容使用扩展到其中,增加的信息头将如下所示,说明运营商如何表示他们将使用他们所访问的内容:
```
Forwarded: for="openai";use="reference"
```

这也符合我们希望鼓励的激励模型。在 Cloudflare 背后超过20%的网站域名失去信任地位是一个有力的威慑。信任成为一种你能携带的东西,同时也是你能失去的东西。

然而,随着 [爬虫流量与人流量融合](https://blog.cloudflare.com/past-bots-and-humans/) ,这套信任转移系统有可能不适用于所有能承担被识别风险的用户。我们今天提出的措施有助于传达信任,但它们并不适用于整个网络的未来。小流量来源需要 [隐私](https://blog.cloudflare.com/internet-privacy/) ,希望维护自身隐私承诺的公司也需要注意这一点。

---

原文链接:[点击查看](https://blog.cloudflare.com/content-independence-day-ai-options/)

评论

暂无评论。