Cloudflare AI Search 更新:一条命令给自己的网站建搜索,AI Agent 直接就能调
- 把网址丢给它,它自己爬完建好索引,然后给你一个
/mcp地址,你的 AI Agent 拿去就能查你的数据。 - Cloudflare 拿它把自家十个站点的文档做成了一个 MCP,专治编码 Agent 张口就来的过期 API。
- 定价把 embedding 和 reranking 做成免费,2 万篇文档加每月 3 万次搜索,官方算下来约 35 美元。
AI Search 是什么,这次更新了什么
Cloudflare 更新了 AI Search,现在一条命令就能给自己的网站或一堆文档建好一个搜索引擎,而且自带一个 /mcp 地址,你的 AI Agent 可以直接把它当工具调用,去查你自己的数据。
以前想做成这件事,得自己把五个零件拼起来。现在这些拼装动作它自己做完了,同时官方放出了定价预览,beta 期间仍然免费。
以前拼五个零件,现在一条命令
要给自己的数据做一套能被 AI 调用的搜索,过去在 Cloudflare 上要动用五样东西:Workers AI 出模型、AI Gateway 管调用、Vectorize 存向量、R2 存文件、Browser Run 爬网页。你得自己把它们串起来,还得自己处理爬取、切块、算向量、检索这一整条链路。
顺带解释两个后面会反复出现的词:embedding 是把文字转成一串数字(向量),搜索时靠比对这串数字找意思相近的内容,而不是死抠字面;reranking 是先粗筛出一批结果、再用另一个模型把最相关的重新排到前面。这两件事在每次建索引、每次搜索时都要跑。
新增的六个能力
- 没有 sitemap 的网站也能整站收录:sitemap 是一份列出网站所有页面地址的清单文件,以前必须有它才能索引整站。现在选 Discover 模式,它顺着页面上的链接自己爬,底层用的是 Browser Run 的
/crawl。 - 一个公开地址搜遍所有数据:在 namespace(装多个搜索实例的盒子)上打开公开 URL,就得到
/search和/mcp两个端点,一次查询横扫盒子里的全部实例,免认证,可以直接甩给客户。 - 能挂自己的域名:把端点变成
search.example.com/mcp这样的地址。 - 要私有就前面加一道 Cloudflare Access:加上之后端点需要登录才能查,只有授权的人或 Agent 进得来。
- 混合搜索让结果更准:混合搜索(hybrid search)是指语义搜索和关键词搜索在同一次查询里一起跑,所以既答得了「这东西是干嘛的」这类开放问题,也精确找得到某个具体名字。
- EmDash 站点装插件即可:EmDash 是 Cloudflare 自家开源的内容管理系统,装上 AI Search 插件,站内内容就有了语义搜索。
Cloudflare 拿自家 10 个站点做了个 MCP
这一节是全文最能说明它能干什么的部分,因为它治的是一个每天都在发生的毛病。
AI 编码助手写 Cloudflare 相关的代码时,用的是训练数据里的旧知识,写出来的常常是过时的 API。现在的补救办法是让它去网页搜索、再抓整个页面回来读,官方对这条路的评价是:慢、费 token,而且经常落到错的或过期的源上。
他们的做法分三步。
第一步:每个站点建一个实例
他们给十个自家站点各建了一个搜索实例:开发者文档、博客、API 文档、社区论坛,以及 Astro、Vite、Vitest、Hono、Replicate、OpenNext 这几个框架的文档站(这些也都在 Cloudflare 名下)。建一个实例就是一条命令,遇到没有 sitemap 的站点加一个参数让它跟着链接爬:
npx wrangler ai-search instance create cloudflare-community \ --namespace dev-stack \ --source https://community.cloudflare.com \ --type web-crawler \ --parse-type discover
第二步:把十个实例合成一次搜索
两条路。写一个 Worker 把 namespace 绑进去,一次调用扇出到你点名的所有实例,他们自己走的这条,因为要把它做成 MCP 服务器里的一个工具。或者干脆不写代码,直接在 namespace 上打开公开端点,立刻得到能查遍全部实例的 /search 和 /mcp,免认证也不用部署。
第三步:挂域名、按需上锁
公开端点自带一个默认地址,可以换成自己的域名。要是这个搜索不该公开,前面加一道 Cloudflare Access,它就变成需要登录才能查的私有端点。
做完这三步,结果是一个地址:把它丢进你的 MCP 配置,编码 Agent 就能一次调用查遍这十个站点的当前文档,返回的内容带出处引用,还标着来自哪个实例。
{
"mcpServers": {
"dev-stack": { "url": "https://stack.mcp.cloudflare.com/mcp" }
}
}
他们自己吃狗粮的范围不止这一处:博客的搜索早就跑在 AI Search 上,开发者文档和 Cloudflare.com 官网也在这次一并接上,全部用的是混合搜索。
定价把最难算的两项做成了免费
先说设计思路,这比价目表本身更值得看。
embedding 和 reranking 这两件事,在每次建索引和每次搜索时都要跑,用量最难提前估算,你没法预知用户会搜多少次、每次要重排多少结果。官方的做法是:用默认模型或 Workers AI 目录里指定的模型时,这两项不收钱。等于把账单里最不可控的那块直接抹平了。
至于答案生成和查询改写,那是可选步骤,跑在你自己选的模型上,按 Workers AI 用量计费,也可以用 AI Gateway 额度接任意模型。
| 项目 | 预览价 | 每月免费额度 |
|---|---|---|
| 基础摄取 | $0.75 / 100 万 token | 500 万 token † |
| 图片处理(加购) | 再加 $0.50 / 100 万 token | 与上共用 † |
| 存储 | $2.00 / GB·月 | 10 GB |
| 语义搜索(含混合搜索) | $0.75 / 1000 次 | 2000 次 ‡ |
| 全文搜索 | $0.10 / 1000 次 | 与上共用 ‡ |
| embedding + reranking | 用指定 Workers AI 模型时免费 | — |
† 每月一个 500 万 token 的池子,各种文件类型共用,图片也算在里面。‡ 每月一个 2000 次的池子,语义和全文两种查询共用。
官方给的示例账单
按 Workers 付费计划,一个 2 万篇文档(约 2000 万 token)的数据源,外加 1000 张图片,每月 3 万次语义搜索,用默认的 embedding 和 reranking 模型:
这个数字要连假设一起看:官方按每篇文档约 10 KB、每张图约 1 MB 估算,摄取时切块有约 10% 的重叠(所以账单里有个 ×1.1)。你的文档更大或图更多,数字就不是这个。
用之前要知道的三条边界
网站来源目前只能是你自己账号下的域名。要把一个网站作为数据源,它必须是挂在你 Cloudflare 账号下的 zone。以后还会加别的所有权验证方式,时间表未定。这条直接决定你能不能用,别等建到一半才发现。
爬取遵守站点的爬虫规则。底下靠 Browser Run 的 /crawl 干活,但它有自己独立的爬虫身份 Cloudflare-AI-Search:遵守 robots.txt、使用固定且公开的 User-Agent 标识、尊重站点已有的爬虫控制策略。
价格是预览版,计费还没开。现在整个 beta 期间免费,官方明确写了正式计费前会提前发邮件通知,而且预览价在开始收费前可能变动。
一条命令就能开一个试:
npx wrangler ai-search create my-search \ --namespace my-namespace \ --source https://my-website.com \ --type web-crawler \ --hybrid-search
网站搜索一条命令建好,AI Agent 直接能调用
Cloudflare 更新 AI Search,把原本要手动拼装的五个组件压成一条命令,一页带图讲完这次都变了什么
↓ 一页读完 · 有一张会动的图
Cloudflare 给 AI Search 做了次更新:现在一条命令就能给自己的网站或文档库建好搜索,自带一个 /mcp 地址,AI Agent 可以直接拿它当工具,去查你自己的数据。
+ R2 + Browser Run
爬取 · 切块 · 算向量 · 检索,自己接
--source https://my-website.com \
--hybrid-search
✔ 开一个公开地址,免登录搜遍一个 namespace(装多个实例的盒子)下的所有数据
✔ 能挂自己的域名,加一道 Cloudflare Access 就变成登录才能查的私有搜索
✔ 混合搜索:语义搜索和关键词搜索一次查询同时跑,模糊问题和精确查名字都能答
✘ 网站来源目前只能是挂在你自己 Cloudflare 账号下的域名
AI 编码 Agent 写 Cloudflare 相关代码时,用的是训练时的旧知识,常吐出过期的 API。Cloudflare 的做法:把开发者文档、博客、API 文档、社区论坛,还有 Astro、Vite、Vitest、Hono 等框架文档各建一个搜索实例,合进一个 namespace,对外只开一个 MCP 地址。
embedding(把文字转成向量方便比对)和 reranking(把最相关的结果排到前面),每次建索引、每次搜索都要跑,用量最难提前估算。Cloudflare 用它指定的 Workers AI 模型时,这两项不收钱,账单里最难猜的那块被抹平了。
这笔账基于官方给的假设,每篇文档约 10KB、每张图约 1MB,实际用量不同,数字也会不同;现在的价格是预览价,正式收费前可能调整。
网站来源目前只能是挂在你自己 Cloudflare 账号下的域名,别的所有权验证方式还没上线,没有时间表。
爬虫用的是独立身份 Cloudflare-AI-Search,遵守 robots.txt 和站点已有的爬虫规则。
整个 beta 现在免费,计费还没开;正式收费前会提前发邮件通知,预览价也可能变动。
- × Workers AI
- × AI Gateway
- × Vectorize
- × R2
- × Browser Run
算向量 · 检索
create --hybrid-search
2 万文档 + 月 3 万次搜索
≈ $35
