Cloudflare 于 2026 年 10 月 9 日在官方博客发布 Clef-omni,把决策模型的输入从文本与图像扩展到音频与视频,一次调用即可跨模态打分;同时宣布 Clef 本体提速、Clef-flash 降价。官方称权重以开放权重形式发布在 Hugging Face,并与 Jev API 兼容。
Cloudflare 推出 Clef-omni:决策模型开始直接吃音频、视频与图片
这次发布的是什么
Cloudflare 于 2026 年 10 月 9 日在官方博客发布 Clef-omni,这是 Clef 决策模型家族的新成员,同时宣布 Clef 本体提速、Clef-flash 降价。此前的 Clef 支持图像与视频帧数组,而 Clef-omni 把输入扩展到音频(wav、mp3)与视频(mp4、webm),加上文本与图像,可以在一次调用里跨模态做决策。官方称模型权重以开放权重的形式发布在 Hugging Face,且 Clef 完全兼容 Jev API,通过 AI Gateway 调用时改模型 ID 即可试用。
可用性与限制
- 调用入口:Workers AI 与 AI Gateway,官方称 Clef 兼容 Jev API,切换的主要工作是改模型 ID。
- 输入模态:文本、图像、音频(wav / mp3)、视频(mp4 / webm);输出仍是按选项打分,不生成文本。
- 开放权重:官方称已在 Hugging Face 发布,自托管的步骤以官方仓库与文档为准。
- Clef-flash 的取舍:托管版上下文窗口从 64k 降到 24k,Clef 仍保持 64k;Hugging Face 上的权重未改动,自托管时的上下文长度以官方说明为准。
- 价格:三档模型的计费方式由开发者文档维护,具体单价以官方文档为准,本文不转述数字。
主要功能
- 一次调用同时处理文本、图像、音频与带声视频,不必先转写或抽帧再判断。
- 对固定选项输出校准后的概率,沿用 Clef 家族按 schema 约束打分的方式。
- Clef 本体的托管速度提升,官方称优化来自服务层,没有更换模型权重。
- Clef-flash 价格下调,官方的定位是让决策模型能嵌进更多工作流。
- 兼容 Jev API,已有调用可按官方说明换成 Clef 的模型 ID。
技术原理
据官方说明,Clef-omni 以 Qwen3-Omni-30B-A3B-Instruct 这个混合专家(MoE)模型为基座,保留其中的理解主干,去掉语音输出部分。推理时它对整个输入做一次 prefill,把所有模态与候选选项一起打分;由于 Clef 系列不是自回归生成文本的大模型,不产生输出 token,因此省掉了转写、字幕这类前置步骤,视频与音频会与视觉帧同步进入统一序列。官方提到的两阶段注意力路由,是让每个候选选项先从输入里收集证据,再由字段向量在全上下文上做交叉注意力算出置信度;内置的词法语法用于保证输出落在给定 schema 内。训练沿用 Clef 的做法:冻结 Qwen3 主干、训练 LoRA 低秩适配,并用标签平滑交叉熵加 Brier 分数校准做后训练。
实际体验
可复现的验证步骤:先找一个现在要靠「转写模型加判断模型」两级流水线才能做的任务(比如根据设备照片、运行录音与一段视频判断风扇是否在转),改成按官方示例把图像、音频、视频与问题一起交给 Clef-omni,对比两条链路的端到端耗时与判定一致率。再挑几段不同长度的音频与视频,记录耗时随输入长度的变化;官方给出的量级是纯文本与图像在百毫秒级,音频在数百毫秒,二十秒左右的带声视频约一秒半。最后把选项描述改写、顺序打乱各跑一遍,看分数是否稳定。具体字段与示例以官方开发者文档为准。
项目地址与获取方式
官方公告在 blog.cloudflare.com,模型入口是 Workers AI 与 AI Gateway;开放权重按官方说明发布在 Hugging Face。请通过官方渠道获取,避免安装被篡改的版本。
适合谁用
- 判断依据天然跨模态的团队:工单里既有照片又有录音,审核材料里既有图又有视频。
- 已经在用 Jev API、想换一个能吞多模态输入的决策模型的开发者。
- 想自托管、对服务层延迟敏感的团队:官方称托管已改用 SGLang 提供服务。
- 什么人不必用:判断只基于纯文本、现有分类器已经够用的场景,换模型的收益有限。
常见问题
Clef-omni 会取代 Clef 吗?
官方把它列为家族新成员而不是替代者:Clef-omni 负责多模态输入,Clef 与 Clef-flash 仍在。选型看输入形态与成本,官方给出的基准对比表建议以官方博客为准。
托管版的上下文窗口为什么要改?
官方称为了让 Clef-flash 的价格更可负担,把托管版上下文窗口从 64k 降到 24k,并说明超过这一长度的请求占比很低。需要更长上下文的,官方建议改用 Clef 或自托管。
开放权重怎么用?
官方称权重已发布在 Hugging Face,并提到新版 SGLang 的启动命令会同步更新。自托管的具体步骤以官方仓库与文档为准。
这次提速改了模型吗?
官方称大部分优化在服务基础设施层,没有发布新的模型权重;服务改用 SGLang,相关改动以 PR 形式提交给了上游,将在 SGLang 0.5.22 提供。
它和生成式多模态模型是什么关系?
两者不是一类东西:Clef-omni 输出的是给固定选项打的分数,不生成文本。如果你需要一段描述或一段对话,那仍然要用生成模型。
相关工具与内容
- 前一篇:Cloudflare Clef 决策模型发布
- 同厂快讯:Cloudflare Web Search API
- 分类:AI 智能体
- 工具页:Dify、Coze
相关内容
微软发布 Microsoft-Decision-1:专做决策打分的模型,已上 Foundry 与 OpenRouter
微软于 2026 年 10 月 9 日在官方博客发布 Microsoft-Decision-1。它不是生成文本的通用大模型,而是决策打分模型:给定一组固定选项,为每个选项输出经过校准的概率分数。官方列出的用途包括路由、分类、优先级排序、校验与工作流控制,模型已在 Microsoft Foundry 与 OpenRouter 上线。
Ollama v0.40.2 发布:旧模型后台升级到 llama.cpp,列表不再出重复项
Ollama 于 2026 年 10 月 8 日发布 v0.40.2(GitHub Release 时间 2026-10-08T16:53:47Z,非预发布)。核心变化是用旧版本下载的模型会在首次运行时后台升级,以在 llama.cpp 上运行时获得更好的性能与兼容性;同时修掉了列表出现重复条目,以及启动 Claude 时没有用满上下文长度两个问题。
Deno 团队加入 Cloudflare:workerd 与 celld 合并,Deno Deploy 六个月后关闭
2026 年 10 月 9 日,Cloudflare 与 Deno 两边的官方博客同步宣布 Deno 团队整体加入 Cloudflare,目标是把 workerd 与 celld 合并,让 Workers 与 Durable Objects 能在自有基础设施上自托管。官方给出的安排是:Deno 运行时再维护一年,Deno Deploy 六个月后关闭,JSR 继续运行。
继续阅读:Ollama v0.40.2 发布:旧模型后台升级到 llama.cpp,列表不再出重复项 · Deno 团队加入 Cloudflare:workerd 与 celld 合并,Deno Deploy 六个月后关闭