揭示代理互联网中的良好与不良行为

发布于

# 揭示代理互联网中的良好与不良行为

互联网并非单一的交通通道。长期以来,网络安全的经验法则是机器人是坏的,而人类是好的。当然,我们早已超越了这种泛化。人类可能存在欺诈行为,而机器人在不同程度上也可以带来帮助。网站拥有者积极希望某些自动化流量与我们的网站互动,以使互联网具备功能和可发现性。

更复杂的是,“人类”和“机器人”之间的界限越来越模糊。现在,我们有了一种“混合”流量类型,在单个会话中,人类和代理行为可以相互切换。(想象一下,一个用户在浏览一家商店,然后将结账流程交给一个自动化的购物助手。)

那么,网站拥有者如何管理这种复杂性呢?这里重要的是评估**行为**。这种行为是否具有攻击性?是否恶意?在这种情况下风险是多少,我能否根据这些行为信任该访客?解决这个问题需要超越静态的、某一时刻的检查。这需要分析持续的行为来评估信任。

在这篇文章中,我们将分享Web完整性与信任团队(涉及机器人和欺诈问题领域)在检测和分析良好与不良行为方面的策略,提供帮助网站所有者应对不断变化的代理互联网的工具。我们还将分享自从推出[Precursor](https://blog.cloudflare.com/introducing-precursor/)以来关于代理流量的发现,以及一个模拟工具,让你看看你的光标移动在被评估为人类还是机器人时的表现——同时还有一些令人兴奋的即将推出的更新。

## 定义风险和信任

让我们谈谈**风险**与**信任**之间的区别,这是我们在处理机器人检测的Cloudflare团队内部讨论的内容。这两者通常被视为连续体的两极。在Cloudflare,我们将其视为独立但相互依存的价值。信任是做出有关流量处理的重要决策的关键成分。

风险是请求或行为有害的可能性,通常是瞬时的。然而,信任是随着时间的推移而建立的,并且基于声誉。

我们可以用一个生活中的例子来说明这一点:假设你在家享受晚间电视,突然听到有人不停按门铃。除了一些烦人,这种行为也很奇怪。晚上疯狂按门铃的确令人感到不安。

你通过门口的摄像头查看,发现按门铃的人是住在隔壁的好朋友。当然,你信任你的好朋友,我们敢打赌你会让他们进来。

在这个例子中,仅仅说“拒绝任何在夜间按门铃的人”或“拒绝任何在夜间按门铃超过10次的人”是不够的。再次强调,信任是关键。

回到互联网流量,随着我们在机器人和欺诈领域构建产品,策略聚焦于基于信任构建整个生态系统。我们的目标是为网站所有者提供激励和原始构件,鼓励那些让互联网更安全的行为:从防止恶意活动开始,到鼓励参与更安全互联网的行为。

## 根植于透明度的良好行为

从上面开始:什么算得上良好行为?我们可以从BotBase中的认证机器人和代理中找到明确的例子。上个月,我们宣布了一个[更新的务实分类法,用于跟踪我们系统中的良好机器人](https://blog.cloudflare.com/content-independence-day-ai-options/),将“[认证](https://developers.cloudflare.com/bots/concepts/bot/verified-bots/)”的定义归结为两点:1)你诚实地声明自己;2)你不滥用获得的信任。

网站拥有者与机器人运营者之间的透明度可以促进共生关系:网站拥有者可以注意到他们希望在网站上允许什么行为和数据使用,机器人运营者可以更轻松地获得访问权限。这种透明度在关系中创造了信任;如果你没有隐瞒,声明你是谁应该会减少想要允许你行为的网站的摩擦。

[BotBase](https://developers.cloudflare.com/bots/botbase/)不仅仅是为了声明“谁是好人”。它旨在成为所有已知机器人和代理的目录,并提供事实。与我们之前的机器人目录相比,后者只包含已知的良好机器人,BotBase还能够跟踪那些不那么好的机器人和代理。为什么?因为我们的系统跟踪并验证已知良好行为者的行为,这意味着我们有工具可以识别何时这些预期未被满足。如果你在Cloudflare网络上滥用信任,你将**不**被轻易允许,因此你将被取消认证。

## 不良行为:公然、隐秘和一切之间

几周前,我们宣布了[Precursor](https://blog.cloudflare.com/introducing-precursor/),这是一个持续的客户端系统,可以检测即使是**微妙的非人类**机器人流量,这种流量在仅根据网络信号评估时可能会被忽视。当客户启用Precursor时,JavaScript检测会被CDN注入,因此不需要坐在计算机前重新运行这些检测。此外,Precursor在整个会话中[持续评估用户行为](https://developers.cloudflare.com/cloudflare-challenges/precursor/),因此不再会有那些通过客户端和浏览器检查的滥用流量一次性逃脱的情况。

将我们的风险和信任框架应用于这些客户端检测,我们可以指出CAPTCHA或一次性障碍是基于风险的,这意味着它们缺乏**上下文**。另一方面,使用行为特征进行验证是基于信任的,因为它可以从整个用户会话中捕获更多上下文线索。Precursor是我们分析这种行为的工具。总结一下,Precursor之所以强大,因为它:

1. 在整个用户会话中提供基于信任的检测。
2. **提升机器人开发者**在多页面时间线上复制人类行为的成本。

通过使得**经济上不划算**的机器人开发者无法超越这些检测,我们赢得了这种对抗性游戏。

那么,自从我们推出以来我们学到了什么?在撰写这篇博客时,我们看到在24小时内有**2.06亿次Precursor评估事件**,跨越**73,438个Cloudflare网络区域**。

我们可以在数据中看到模式,揭示了在推出检测时我们怀疑的事情,但现在可以在数万个域中验证:

- 可疑行为通常发生在会话的中间,此时一次性检测无法捕获。
- **行为通常在会话中从人类切换为代理,然后再切换回来**。在这些情况下,了解**意图**是至关重要的,以便网站所有者不阻止他们实际想要的用户流。
- 这突显了机器人分类系统的重要性,使网站所有者能够根据用例、用途和数据使用来处理流量。这正是我们优先更新BotBase分类法的原因。

对于那些希望了解Precursor如何实际工作的用户,我们分享了一些预览——我们分析的信号如何显示人非人:在我们发布的[博客文章](https://blog.cloudflare.com/introducing-precursor/)中有详细信息。**今天,我们更进一步:向互联网的任何人提供一个互动演示,模拟Precursor如何追踪你的光标移动。**

**[Precursor Trace](https://precursor-trace.cloudflare.app)**现已上线,分享我们如何使用(部分)Precursor的检测机制评估**你的**光标移动。在这里,你可以看到你是在加速还是在纠正自己,光标移动的节奏和纹理,等等——这些都是你作为一个与计算机真实互动的人可能从未想过的内容。快来试试吧!

## 自适应智能即将到来

Cloudflare的[机器人检测引擎](https://developers.cloudflare.com/bots/concepts/bot-detection-engines/)在评估某个请求是否自动化时,可以产生不同的[结果](https://developers.cloudflare.com/bots/concepts/bot-score/#bot-groupings)。对于被认为是自动化的请求,评估可以是1)基于已证明的决定性方法或机器人的指纹确定为自动化,或2)基于Cloudflare的Bots ML预测得出可能自动化。

历史上,[Bots ML](https://developers.cloudflare.com/bots/concepts/bot-score/#machine-learning)是分版本更新的,这意味着我们每发布一个新模型版本都作为产品发布。这种节奏在机器人以小时甚至分钟的速度适应时并不奏效。

自适应智能,全新的检测引擎,与我们以前在机器人ML领域构建的任何东西都不同。**该模型本身是自适应的**。它从我们过去看到的所有数据中学习,但更重要的是,它将**持续**学习并基于观察进行自我调整。自适应智能将根据我们识别的各种流量模式,从良好到不良行为,进行升级,客户将不再需要升级到正式的新模型版本以使用最新的预测机器人检测。

所有机器人管理客户将在不久的将来访问自适应智能——请关注即将发布的公告。

## 超越决定论,影响机器人行为

到目前为止,我们专注于Cloudflare的一切:战略、检测和分类法。所有这些使Cloudflare能够为网站所有者提供所需的工具,以便在其网站上设置所需的流量策略。再聚焦于网站所有者,我们希望借此机会讨论一些**高级缓解措施**,允许网站所有者自己影响机器人行为。

对于更明显的缓解技术,我们面临一个被称为“机器人抗生素问题”的挑战。始终对机器人发送决定性的响应(如403屏蔽)使得恶意开发者的机器人很容易测试、观察和逆向工程你的防御。

我们知道这一点,因此我们正在设计专门用于给机器人限流的缓解措施——针对恶意机器人和良性机器人的不同方法。我们可以将其分为三种方法:

1. **不可预测性和随机行为**。针对怀疑的自动化流量应用随机响应(阻止、挑战或允许之间的随机选择)可以打破机器人的自动重试逻辑和指纹识别。
2. [**AI Labyrinth**](https://developers.cloudflare.com/bots/additional-configurations/ai-labyrinth),一种防御性响应,将未经授权的机器人困在无尽的AI生成网页迷宫中。你可以通过使用**误导**来浪费恶意机器人的计算和爬取预算。网站所有者将根据他们的偏好,在AI Labyrinth中拥有三种选择:
- **迷宫**:生成无尽的相互链接的页面供机器人跟随。
- **摘要**:向爬虫提供LLM生成的页面摘要,看似真实但完全无用的AI训练数据。
- **污染**:向机器人提供故意假内容(如虚假的价格或库存),污染其收集的用于AI训练的数据。
3. **对良性机器人排队**。并非所有代理流量都是坏的;排队管理可以管理合法自动化流量的吞吐量(如用户导向的购物代理),而不是完全拒绝服务。

这些先进的、针对机器人的缓解措施预计将在今年年底推出,网站所有者将能够选择其缓解措施的严格程度。

我们也知道,一个良好的防御是预测性的——即在没有多个安全专家通话来动态制定补救措施以应对最新隐性攻击的情况下进行自我学习和纠正。这可能看起来像是拥有一套“可消耗”的规则,其中规则集是动态的。这是出于设计考虑:如果攻击不断演变,防御也应如此。这就是为什么我们正在努力保持检测和缓解始终领先一步。

## 建立适合你的信任生态系统

任何人都可以采取步骤来定义自动化代理与其基础设施的互动。

以下是一些可以尝试的步骤:
- 启用[Precursor](https://developers.cloudflare.com/cloudflare-challenges/precursor/#get-started)
- 尝试使用[Precursor Trace](https://integrityand.trust.cfdata.org/precursor-trace/)
- 探索[BotBase](https://developers.cloudflare.com/bots/botbase/)

通过远离静态、瞬时检查并拥抱持续的信任评估,我们减少了与机器人运营商的“打地鼠”游戏。如果你还没有使用[Cloudflare的机器人检测](https://www.cloudflare.com/products/bot-mitigation/),那么可以了解一下并建立适合你的信任生态系统。

---

原文链接:[点击查看](https://blog.cloudflare.com/good-and-bad-agentic-behaviors/)

评论

暂无评论。

0.041659s