Cloudflare 于 2026 年 10 月 2 日宣布在 AI Gateway 中引入网页搜索能力,首批合作提供方为 Ceramic.ai、Exa 与 Linkup。搜索调用走 Gateway 额度、留 Gateway 日志、按 Gateway 受控,并支持自带密钥,官方称按合作方公开目录价结算、不加价。可用形态包括 REST 接口与 Workers 绑定,原生 Server Tools 形态仍在开发中。
AI Gateway 上线搜索接口:给智能体接实时联网
这次发布的是什么
Cloudflare 在 2026 年 10 月 2 日的官方博客上宣布,为 AI Gateway 引入网页搜索能力,文章标题是《Introducing Web Search API via AI Gateway》。首批合作的搜索提供方有三家:Ceramic.ai、Exa 与 Linkup。
Cloudflare 给出的动机很直接:智能体需要抓取一个网页时,通常的做法是先猜一个 URL 再发起请求,猜错就收到 404。网页搜索让智能体可以像人一样从一次检索查询出发,先拿到实时的结构化片段,再放进上下文,从而把回答锚定在活的信息上。
这不是一个面向终端用户的消费级产品,而是嵌进 AI Gateway 控制面的一项能力:请求走 Gateway,额度从 Gateway 余额里扣,日志留在 Gateway 的观测记录里,谁能访问哪个搜索提供方也由 Gateway 统一控制。
影响谁:在 Cloudflare Workers 或自家后端上跑智能体的开发者,尤其是回答会碰到最近事件、接口变更、新闻演进这类「超出模型知识截止日期」内容的场景。
可用性与限制
- 需要 Cloudflare 账号并启用 AI Gateway:网页搜索调用从 AI Gateway 的信用额度里扣减,具体计费口径以官网为准。
- 提供方有限:上线时的可选提供方为 Ceramic.ai、Exa 与 Linkup;payload 里 provider 字段的取值与后续新增名单,以官方文档为准。
- 两种形态可用、第三种在路上:REST 直接调用与 Workers 绑定现在就能用;官方提到正在把原生 Server Tools 直接做进 AI Gateway,届时不必自己定义工具,但这一形态尚未上线。
- 也支持自带密钥:与推理侧一样,Bring-Your-Own-Key 可用,已有组织级账号配置的团队可以沿用现有采购关系。
- 数据策略待确认:官方称会标识出支持零数据保留(Zero Data Retention)的提供方,但每一家的实际条款以提供方与官方文档为准。
- 平台可达性:Cloudflare 各项服务在中国大陆的访问情况以 Cloudflare 官方说明为准,本文不做可用性承诺。
主要功能
- 注入实时上下文:把搜索结果转成结构化片段塞进模型上下文。
- 统一结算:用 AI Gateway 额度支付搜索调用,不必单独跟搜索厂商对账。
- 留痕与观测:搜索请求出现在 AI Gateway 的观测日志里,可查请求数据。
- 权限收敛:按 Gateway 控制谁能访问哪个搜索提供方。
- 支持自带密钥:沿用组织既有的提供方账号与协议。
- 标注数据策略:官方会标出支持零数据保留的提供方。
技术原理
据官方博客,网页搜索解决的是模型训练完就被冻结在某个时间点这件事:之后发生的事件、变过的接口、演进中的新闻,模型都无从得知。把搜索直接接进推理管线,等于给模型加了一层动态上下文层,让结果片段在请求时就注入上下文,而不是等人手动粘贴。
在实现上,AI Gateway 充当控制面。走 REST 时,开发者带上 Gateway 认证信息、在请求体里指定 provider 与返回条数上限即可;走 Workers 时,官方把它简化成一行绑定调用。两条路的差别只在调用形态,背后的路由、日志与额度逻辑是同一套。
这次发布里还有一个容易被忽略但对内容方更重要的部分:Cloudflare 要求合作方满足它对「良好爬虫」的标准。检索提供方使用的爬虫必须符合其开发者文档中对 Verified bots 的公开要求,搜索响应必须带上被抓取内容的链接,并且要尊重 robots.txt。换句话说,返回结果里应当能看到来源地址,这为下游做引用标注留了余地。
实际体验
本站未做实测,下面给出可以自己复现的自查步骤。
第一步先看文档:打开 Cloudflare 的 web-search 开发者文档,确认你账号下的 AI Gateway 是否已支持该项、provider 的取值以及返回结果的结构。不要照抄二手文章里的字段名,字段名会随版本改。
第二步在 Playground 试:官方在 AI Playground 里提供了试用入口,用你的 AI Gateway 账号与密钥登录,先跑一条跟你业务相关的查询,看返回的片段是否带来源链接、时效是否满足要求。
第三步接进智能体:在 Worker 里用绑定方式调用一次,把返回结果拼进消息历史再喂给模型,确认模型能真正引用这些片段。可以顺手做个对照:同一任务,一次让模型直接猜 URL 去抓,一次先搜索再抓,成功率与耗时的差别会很明显。
第四步回到观测面板:确认搜索调用被正确计数,没有被误归到推理调用里,同时看看额度消耗的速度是否符合预期。
项目地址与获取方式
网页搜索不是一个独立的开源项目,入口全在 Cloudflare 官方:文档在 developers.cloudflare.com 的 web-search 页面,试用在 AI Playground,开通与额度管理在 Cloudflare 控制台的 AI Gateway 里。
请通过官方渠道开通,不要使用第三方中转服务。这类中转会把你的 API 密钥与全部查询内容暴露给不受控的一方,排查起来也很麻烦。
适合谁用
- 做问答型智能体的开发者:回答依赖近期信息的场景收益最直接。
- 已经在用 AI Gateway 的团队:不新增供应商,账单还是那一张。
- 需要治理能力的团队:要求留痕、要求按 Gateway 分权限的组织。
- 不必用的情况:知识范围固定、答案都在自有知识库里的场景,先把它做成检索增强更可控也更省,不必引入外部来源的不确定性。
- 部署区域也是前提:先确认 Cloudflare 平台在你的目标区域可用,再决定是否放进关键路径。
常见问题
它和 Perplexity、秘塔这类搜索产品有什么区别?
定位不同。前者是成品,你输入问题、它给你答案,检索过程封装在别人手里;Cloudflare 这项是给开发者的基础设施,你拿到的是可编程的结果片段,自己决定拼进哪个模型、怎么引用、要不要过滤域名。一个是「用别人的搜索」,一个是「把搜索装进自己的管线」。
有了它还需要做 RAG 吗?
需要,两者是互补的而非替代。自有文档、客服知识库这类确定性高、可控性强的语料,走向量检索更合适也更省;网页搜索补的是「知识在模型截止日期之后」的那部分增量信息。多数落到生产上的系统是两条路并存,由一层路由判断这次该走哪条。
会不会突然烧掉很多额度?
单价与配额以 Cloudflare 官网为准。官方说明它的结算方式是按合作方的公开目录价、不额外加成,但每一次搜索都消耗 AI Gateway 的额度。建议上线前先在观测面板跑一小批代表性任务,估算单次任务的搜索次数与开销,别等到账单出来再回头查。
搜索结果的来源能查到吗?
按 Cloudflare 的要求,合作方必须符合其开发者文档中 Verified bots 的公开要求,搜索响应必须带上被抓取内容的链接,并尊重 robots.txt。这意味着返回结果里应当带上来源地址,方便你在产品里做引用标注。具体履行情况以提供方与官方文档为准。
支持自带密钥吗?
支持。官方说明 AI Gateway 对网页搜索提供方同样支持 Bring-Your-Own-Key,与推理侧的用法一致。已经在某家检索服务上有企业级账号的团队,可以沿用现有的采购与合规关系,不必重走一遍流程。
相关工具与内容
- /category/search — AI 搜索分类,各类 AI 搜索工具都在这里
- /tool/perplexity — Perplexity,成品 AI 问答搜索的代表
- /tool/metaso — 秘塔 AI 搜索,中文检索场景的常见选择
- /tool/genspark — Genspark,面向研究与任务式检索场景
- /category/agent — AI 智能体分类,需要联网能力的智能体在这
- /tool/coze — Coze,可在工作流里编排检索节点的平台
相关内容
OLMo-core 3 发布:主攻混合专家训练与导出校验
Ai2 于 2026 年 10 月 1 日为 OLMo-core 打出 v3.0.0 版本标签,重心偏向混合专家(MoE)训练与导出:新增元数据来源的文档边界开关、可选 SwiGLU 反向优化、每头 Q/K 归一化增益与 EMO 路由,并给混合 MoE 的 Hugging Face 导出加上精确张量往返校验与一批拒绝规则。同时移除了 model_ladder API 及十一个相关训练脚本。
Claude Frontier Academy 成立:企业 AI 落地人才怎么补
Anthropic 于 2026 年 10 月 2 日宣布成立 Claude Frontier Academy,并推出首个项目 Frontier Deployed Engineer Residency,采用多日线下启动加驻留期的两段式培养,走医学培养模型的路子。参与方式为组织提名,不开放个人报名,首批 cohort 在旧金山、纽约、伦敦运行。
GPT-6 Astra Ultrafast 上线:主打更快的词元生成
OpenAI 的 GPT-6 Astra Ultrafast 于 2026 年 10 月 1 日经 NVIDIA 官方博客宣布可用,运行在 NVIDIA Blackwell GPU 上,面向 OpenAI API 用户以及符合条件的 ChatGPT Work 与 Codex 用户开放。官方口径为词元生成速度至高可达标准模式的 8 倍。它不是新模型,而是同一模型上更快的一档推理档位,且与推理强度旋钮相互独立。
继续阅读:GPT-6 Astra Ultrafast 上线:主打更快的词元生成 · AI 语音工具怎么选:转写、配音、配乐的三条线