Cloudflare 于 2026 年 10 月 1 日发布两个自研决策模型 Clef 与 Clef-flash,托管在 Workers AI,同时以 Apache 2.0 协议在 Hugging Face 开放权重。模型只输出类型化判断与概率而非自由文本,带视觉编码器与 64K 上下文,接口与 Jev 兼容。同日还预告了基于强化学习的微调服务。
Cloudflare 开源 Clef:只输出结构化判断与概率
这次发布的是什么
Cloudflare 于 2026 年 10 月 1 日在官方博客宣布推出两个自研决策模型 Clef 与 Clef-flash,托管在 Workers AI 上,同时以 Apache 2.0 协议在 Hugging Face 开放权重。同一次发布还预告了一项新的强化学习微调服务。
决策模型是近来出现的一类模型:它不像通用大模型那样生成任意文本,而是在给定选项里做判断,并给出对应的概率。官方举的例子是,把一条客服消息传进去,问它是否紧急、应该转给哪个团队,模型返回带概率的类型化答案,你的代码据此决定是路由、升级还是转人工。Clef 的输出分为 noul(是否判断)、choice(多选一)与 score(打分)三类,官方称其与 Jev 的接口兼容。
影响谁:在做智能体工作流的开发者。过去每一个小的路由判断都要消耗一次大模型调用并等它写一段话,决策模型把这类判断变成一次廉价、可设阈值的结构化调用。
可用性与限制
- 托管渠道:两个模型托管在 Workers AI,通过 Cloudflare 账号调用;官方示例里的模型标识符为 @cf/cloudflare/clef。
- 开放权重:官方称已在 Hugging Face 以 Apache 2.0 协议开放,可下载到本地自行运行与实验。
- 上下文与输入:官方写明 Clef 带视觉编码器,可接受图像输入;上下文窗口为 64K token。具体支持哪些图像格式以官方文档为准。
- 微调服务:官方说明先以 FDE(前置部署工程师)团队 hands-on 合作的形式提供,自助微调平台是后续计划,当前尚未上线。
- 数据处理承诺:官方称不读取、不存储、不基于用户的请求与响应训练,使用微调产品的情况除外。
- 接口兼容:官方称与 Jev 的接口完全兼容,但字段与行为的一致程度请以官方文档为准。
- 境内可达性:Cloudflare 与 Hugging Face 服务在境内的访问情况请以各自官方说明为准,本文不做可用性承诺。
- 定价:以 Cloudflare 官网定价页为准。
主要功能
- 输出类型化判断:支持是否判断、多选一与打分三类,每一类都附带概率。
- 接受图像输入:内置视觉编码器,可对截图或渲染后的网页直接分类。
- 一次问多个字段:同一个输入下可以批量提出多个问题,官方称这是该类模型的效率优势之一。
- 给出可校准置信度:每个判断带概率值,便于代码设阈值决定何时转人工。
- 边缘 GPU 托管:跑在 Workers AI 上,不必自备显卡即可接入。
- 兼容既有接口:官方称与 Jev 接口兼容,替换成本较低。
- 支持后续微调:官方提供面向特定场景的强化学习微调服务。
技术原理
据官方博客说明,Clef 的骨干网络用的是 Qwen 系列模型:Clef 冻结 Qwen3.8-27B,Clef-flash 冻结 Qwen3.5-9B,再联合优化一个路由头与 rank-256 的低秩适配器。
推理过程与自回归大模型不同。官方描述为先对输入做一次仅预填充(prefill-only)的读取,把情况载入模型内部状态,然后并行地为 schema 里所有合法选项打分。因为决策这一步不是自回归的,模型不需要先逐 token 生成一段中间文本再得到答案,这正是它能比同规模自回归模型快的原因。
官方进一步把架构概括为三件事的组合:面向选项的证据路由、跨字段的联合交叉注意力、以及绑定 schema 的打分;并提到借助词汇先验来保持选项之间的语义一致性。训练目标上,官方称对合法 schema 输出使用带标签平滑的交叉熵,并配合 Brier 损失来校准概率;此外自研了名为 RLCD 的强化学习目标,对相邻的序数选项给部分得分、对完全精确的记录给完整奖励,并施加参考惩罚以防止分布漂移。
实际体验
决策模型适不适合你的场景,跑一次就能判断。下面是可复现的验证步骤:
- 先走托管接口:用 Cloudflare 账号调 Workers AI 上的 Clef,传入一段状态描述,再定义一组问题,覆盖是否判断、多选一与打分三类,观察返回结果是不是带概率的结构化字段。
- 改 schema 看变化:增减选项、调整措辞,确认输出会跟着 schema 变,而不是沿用固定标签。
- 试图像输入:把一个渲染后的页面或截图交给模型分类,验证视觉编码器是否按预期工作。
- 设阈值做分流:在代码里给概率设一个阈值,低于阈值时转人工处理,观察被分流掉的case是否符合预期。这一步最能看出置信度是否真的可用。
- 本地跑一遍:从 Hugging Face 下载 Apache 2.0 权重,在本地环境对比与托管版的差异,确认部署形态是否满足你的合规要求。
项目地址与获取方式
- 官方公告:https://blog.cloudflare.com/clef-decision-models/ (页面标注 October 1, 2026)
- 托管调用:Workers AI,官方示例中的模型标识符为 @cf/cloudflare/clef,具体接入方式见 Cloudflare 开发者文档。
- 开放权重:Hugging Face 上的 Cloudflare 官方仓库,Apache 2.0 协议,可自行下载运行。
- 请通过 Cloudflare 与 Hugging Face 官方渠道获取模型与权重,避免安装被篡改的版本。
- 具体定价与配额以 Cloudflare 官网为准。
适合谁用
- 需要高频路由与分类的智能体:工单分派、意图识别、紧急度判断这类判断密集的场景。
- 想在关键路径加护栏的团队:用概率阈值决定何时升级或转人工。
- 已经在用 Workers AI 的开发者:可以和大模型搭配,让判断走快路径、生成走慢路径。
- 需要图像参与判断的场景:截图或渲染页面可以直接作为分类输入。
- 不必用的人:需要生成文本、写代码、做对话或文档摘要的场景。官方明确写明了这类模型不擅长这些任务,也不如推理模型擅长复杂问题。
- 暂不建议依赖的场景:需要自助微调的业务,官方的自助平台尚未上线。
常见问题
决策模型和普通大模型有什么不同?
普通大模型生成任意文本,决策模型只在给定选项里选,并给出每个选项的概率。换来的是更快、更稳定,而且一定从你给的选项里产出答案;代价是它不生成文本,因此不适合写代码、聊天、摘要这类任务。官方还强调决策模型给每个判断附带一个可靠性评分,这一点在主流大模型的推理接口里通常拿不到。
Clef 能处理图片吗?
能。官方写明 Clef 带视觉编码器,可以接收图像并对视觉内容做分类,这也是它与只做文本分类的同类模型的主要区别之一。官方内部的一个用法是配合浏览器渲染,抓取一个域名后对页面内容分类。具体支持哪些图像格式与尺寸限制,以官方文档为准。
权重可以自己部署吗?
可以。官方称已在 Hugging Face 以 Apache 2.0 协议开放这两个模型,可以下载到本地运行和实验。Apache 2.0 是宽松的开源许可,但商用前仍建议阅读对应的模型卡与使用条款。托管版则通过 Workers AI 调用,不需要自备显卡。
与 Jev 的接口兼容到什么程度?
官方称 Clef 产出的类型化输出与 Jev 类似,且接口完全兼容,因此替换起来比较容易。不过兼容到哪些字段、哪些边界行为一致,官方公告没有逐项列出,实际迁移前请以 Cloudflare 开发者文档为准,并先在非关键路径上验证。
微调服务现在就能用吗?
部分是。官方说明微调服务先以 FDE 团队合作的形式提供,也就是由 Cloudflare 的工程师和你在真实负载上一起做,之后再推出自助平台。自助平台的流程官方已经给出雏形:用 AI Gateway 采集请求数据生成数据集,用 Workers AI 生成候选结果,用 Containers 作为强化学习沙盒打分与回放,再用 Trainer 更新权重并重新部署到 Workers AI。具体排期以官方公告为准。
相关工具与内容
- /category/agent — AI 智能体分类,决策模型主要服务的工作流都在这一页
- /category/code — AI 编程分类,接入这类模型的工程侧入口
- /tool/make — Make,可视化自动化编排,可直观看到路由判断的位置
- /tool/n8n — n8n,自建自动化工作流,适合接结构化判断
- /tool/coze — 扣子 Coze,智能体搭建平台,可对照看工作流中的判断环节
- /article/ollama-decision-models-2026-09 — Ollama 引入 decision models,同一类模型的本地跑法
相关内容
Claude Code Mods:插件能改写提示、拦截工具调用
Claude Code 于 2026 年 10 月 1 日发布 v2.1.287,新增 Claude Code Mods:由 JavaScript 或 TypeScript 事件处理函数组成的插件,运行在 Claude Code 内部,可改写提示词、拦截或接管工具调用、重画界面并注册自定义命令。同版本还带来内置的 You should know 旁路提醒 mod。Mods 不被沙箱隔离,官方要求只从信任的来源安装。
微软 MAI 语音三件套:流式转录 60 种语言,合成 23 种
微软于 2026 年 10 月 1 日在 Microsoft Foundry 上线三个 MAI 语音模型:流式转录的 MAI-Transcribe-2-Streaming 覆盖 60 种语言并自动检测语种,边收音频边产出文本;合成侧推出 MAI-Voice-2.1 与其高速档 MAI-Voice-2.1-Flash,覆盖 23 种语言且跨语言保持同一音色。三个模型同时上线 OpenRouter、Vercel 与 LiveKit。
TraeWork 值不值得用:智能体能装配,配好才好用
TraeWork 在本站五维评测口径下总分 4.3:生态集成 4.3 靠的是 MCP 装配外部工具、联网检索与文档集接入,以及智能体能分享到市场复用。代价是配出好用的智能体要先投入时间,产出仍须逐条验收。本文逐项给出依据。
继续阅读:微软 MAI 语音三件套:流式转录 60 种语言,合成 23 种 · 稿定设计值不值得用:电商物料一条龙,物料杂了就露短