Cloudflare AI 搜索:为您的代理提供数据搜索引擎

发布于

今天,我们很高兴地宣布对 [Cloudflare AI 搜索](https://developers.cloudflare.com/ai-search/) 进行了一些开发者体验的改进,使得基于云的搜索解决方案的管理变得简单。以前,您需要将 Cloudflare 的基础组件(Workers AI、AI Gateway、Vectorize、R2、Browser Run)拼接在一起,但现在,AI 搜索可以自动完成这项工作,并且做得更好。我们的目标是为您的代理提供自己的搜索引擎,让他们能够轻松找到数据,从而为自己和他们的客户提供更好的答案。

我们还分享了 AI 搜索客户定价的早期预览,以帮助您了解该服务的规模化情况。我们的定价模型旨在使其可预测并可扩展:使用默认模型时,嵌入和重排名是免费的,因此您无需担心预测令牌数。

在 AI 搜索中,用户现在可以:

- **为您的代理索引数据集合:** 使结构化和非结构化数据易于您的代理访问,从单个文件到您拥有的网站。(目前,它必须是您 Cloudflare 账户中的一个区域,但我们即将推出更多验证拥有权的方法。)
- **跳过您网站的站点地图:** 之前,AI 搜索要求网站必须有站点地图才能使用网站集成。现在,您可以选择“发现”解析选项,将没有站点地图的网站作为数据源。
- **获得一个公共端点以跨命名空间搜索:** 当您在命名空间上启用公共 URL 时,您可以获得一个 `/search` 和 `/mcp` 端点,它可以在多个实例或网站之间进行无认证的搜索,以便您能方便地与客户共享。
- **为公共端点添加自定义域名:** 您现在可以为您的公共 URL 添加自定义域名,以便您可以为您的 `/search` 和 `/mcp` 端点进行品牌化(例如:`search.example.com/mcp`)。您还可以添加 [Cloudflare Access](https://www.cloudflare.com/products/access/) 来创建私有搜索实例。
- **对基于 EmDash 的网站使用 AI 搜索插件添加语义搜索:** 如果您的网站运行在 [EmDash](https://github.com/emdash-cms/emdash) 上,我们的 [AI 搜索插件](https://docs.emdashcms.com/deployment/cloudflare/#cloudflare-ai-search) 将为您的内容添加语义搜索功能。
- **预览 AI 搜索的新定价模型:** 我们希望定价是可预测的,并且与您的规模一起增长,因此我们构建了嵌入和重排名的费用:在使用 Workers AI 目录中的选择模型时,它们是免费的。

最后,我们还将分享 AI 搜索在我们自己的平台上的一些应用案例,包括 [Cloudflare.com](http://Cloudflare.com)、我们的开发者文档、EmDash及 Cloudflare Dev Stack MCP——甚至是您现在正在阅读的这篇博客文章(尝试按 cmd+K)。

## AI 搜索在实践中:提供新的 Cloudflare Dev Stack MCP

我们使用 AI 搜索的方式之一是在我们新的 **Cloudflare Dev Stack MCP** 中,您现在可以在我们的 [AI Playground](https://playground.ai.cloudflare.com) 中尝试。它为编码代理提供来自整个 Cloudflare 开发生态系统的最新、引用过的文档,以便他们基于最新的功能和修复进行构建,而不是过时的训练数据。

以下是我们如何使用 AI 搜索中可用的功能来构建它的:

### 1. 为每个表面创建索引

我们为每个 Cloudflare 所有的表面创建了一个 AI 搜索实例:文档、博客、API 文档、社区、Astro、Vite、Vitest、Hono、Replicate、OpenNext。(这些都是 Cloudflare 所有的。)它们跨越不同的域名,但由于 Cloudflare 拥有这些网站的数据,AI 搜索能够将它们视为一个整体,并以相同的方式进行摄取。只需将 AI 搜索指向一个网站或一组网站,它就可以处理爬虫、摄取、嵌入和检索。创建实例只需一条命令,对于没有站点地图的网站,您可以添加 `--parse-type discover` 来通过链接查找页面(由 Browser Run 的 `/crawl` 支持)。

### 2. 将实例组合成一个搜索

现在有趣的部分是:在所有 10 个实例中回答一个查询。有两种方法可以做到这一点。

**选项 A:在 Worker 中(这是我们为 Cloudflare Stack MCP 所做的)**
我们将命名空间绑定到一个 Worker,以创建一个 [远程 MCP 服务器](https://developers.cloudflare.com/agents/model-context-protocol/guides/remote-mcp-server/),并跨所有 10 个实例进行一次多实例调用。我们选择了这条路径,因为我们将堆栈搜索添加到 [Cloudflare 的 MCP 服务器](https://github.com/cloudflare/mcp-server-cloudflare) 中,所以它作为工具随 Cloudflare 工具一起发布。

在 `wrangler.jsonc` 中的绑定:

然后一个单独的工具发出一次调用,它扩展到您命名的所有实例。

**选项 B:开启公共端点(无需代码)**
如果您根本不想编写 Worker,请在命名空间上启用公共 URL。您将立即获得查询每个实例的 `/search` 和 `/mcp` 端点,无需身份验证,也无需部署。

在将搜索整合到现有应用或者 MCP 服务器中时,请使用 Worker;或者当您只想要一个可共享的搜索端点时,请使用公共端点。

### 3. 品牌化并加锁

公共端点带有默认的公共 URL,但您可以在其上放置自己的一道 **自定义域名** 来对端点进行品牌化(例如:`search.example.com/mcp`)。

如果搜索应该是私有的,请在域名前添加 **Cloudflare Access**。此时,端点需要登录,因此只有授权用户(或代理)可以查询它。

## 自己试试:使用 Dev Stack MCP

使用 Cloudflare Dev Stack MCP 服务器,您可以询问任何工具,或者描述您想要构建的应用,您将获得关于如何在 Cloudflare 堆栈上最佳构建的当前和引用过的答案。

[AI Playground](https://playground.ai.cloudflare.com) 值得您查看,但真正的魔力是将 MCP 集成到您的编码代理中,这样堆栈的当前文档就只需一个工具调用即可获取。这替代了通常的回退(网络搜索,然后获取整个页面),这又慢、耗令牌,并且经常落入错误或过时的来源。要与您选择的代理一起使用,只需将 Dev Stack MCP URL 放入您的 MCP 配置中。例如:

## 在我们的博客、开发者文档和 [Cloudflare.com](http://Cloudflare.com) 上提供搜索

我们构建 AI 搜索的方式与客户相同:Cloudflare 博客的搜索已经在使用它,而今天开发者文档和 [Cloudflare.com](http://Cloudflare.com) 也加入了。所有这些使用了混合搜索,将语义和关键字结合在一个查询中,因此能够处理开放式的“这是什么”问题和对名称或关键字的精确查询。我们最近在 EmDash(我们的新开源 CMS)上重建了博客,而我们的新 [EmDash AI 搜索集成](https://docs.emdashcms.com/deployment/cloudflare/#cloudflare-ai-search) 正在为该搜索提供动力。您还可以将其添加到您自己的 EmDash 网站,轻松获得对您内容的相同搜索。

## AI 搜索遵循所有机器人协议

AI 搜索是由 Browser Run 的 `/crawl` 支持的,但更进一步,使用自己独特的机器人身份标识:`Cloudflare-AI-Search`。和 Browser Run 一样,它遵循 robots.txt,自我标识,使用不变的公共用户代理,并尊重网站上所有的机器人控制。

## 预览定价:您可以预测的定价

AI 搜索在 beta 期间目前是免费的,且尚未启用计费;在启用之前我们会提前通知您。随着通用可用性的推进,以下是关于摄取、存储和查询的定价预览,此外还包括嵌入和重排名(*预览价格在计费开始前可能会有所变化*):

*† 每月一组 500 万个摄取令牌,覆盖任何当前支持的文件类型(例如,文本、图像)。‡ 每月 2000 个查询的单一池,共用于两种查询类型。*

我们的目标是提供您可以预测的定价,从您搜索所依赖的模型开始。嵌入将您的文本转换为搜索匹配的向量,而重排名则对结果进行重新排序,使最相关的结果排在前面。这两者在 AI 搜索默认设置下运行免费,或者使用 Workers AI 目录中的选择模型,因此索引和每个搜索背后的模型不是您需要担心的成本。答案生成和查询重写是可选步骤,使用您选择的模型进行计费,或者您可以使用 AI Gateway 信用与任何模型/提供商。

### 预览定价的示例账单

以下是创建 AI 搜索实例的示例月账单,数据源为 20,000 个文档(大约 2000 万个文本令牌)加上 1000 个图像(假设每个约 1000 个令牌),每月使用默认的 AI 搜索嵌入和重排名模型进行 30,000 次语义查询。摄取是分块的,大约有 10% 的重叠,这在下面显示为 × 1.1:

图像计入基本摄取并会产生图像附加费用。存储假设每个文档约 10 KB,每张图片约 1 MB。索引主要是一项一次性成本,因此后续几个月主要是查询,接近 21 美元。

## 今天就开始

AI 搜索现在可以启用和使用。将其指向您的网站,开启语义和关键字匹配的混合搜索,您就拥有了一个适合您代理的数据搜索引擎。只需一条命令即可启动:

从那里,查询它,与代理通过 `/mcp` 连接,或在公共 `/search` 端点上放置自定义域名,与您的用户共享。请查看 [AI 搜索文档](https://developers.cloudflare.com/ai-search/) 以获取更多信息。

---

原文链接:[点击查看](https://blog.cloudflare.com/ai-search-easier/)

评论

暂无评论。

0.041491s