Cohere 于 2026 年 9 月 30 日发布 Embed 5 嵌入模型家族,含 Pro 与 Fast 两档,模型名为 embed-v5.0-pro 与 embed-v5.0-fast。两档共享同一个嵌入空间,可用 Pro 建索引、用 Fast 承接在线查询而无需重建向量库。支持文本与图像输入、100 多种语言、128K token 上下文与多档输出维度。
Cohere 发布 Embed 5:Pro 与 Fast 共享同一个向量空间,索引和查询可以分开选
这次发布的是什么
Cohere 于 2026 年 9 月 30 日发布 Embed 5,一个新的嵌入模型家族,包含 Embed 5 Pro 与 Embed 5 Fast 两个档位,官方 API 中的模型名分别为 embed-v5.0-pro 与 embed-v5.0-fast。官方公告页为 Cohere 博客的「Introducing Embed 5」,页面标注日期 Sep 30, 2026;开发者文档侧的 changelog 页同步上线了对应条目。
这次发布里最值得注意的是一个结构上的设计:Pro 与 Fast 共享同一个嵌入空间。官方的说明是,用其中一个模型建的索引,可以直接用另一个模型去查询,不需要重建向量库;官方推荐的搭配是用 Pro 做离线索引、用 Fast 承接在线查询。这意味着「建库质量」和「查询延迟」第一次可以在同一个索引上分别取舍。
影响谁:做企业搜索、RAG(检索增强生成)和智能体检索的团队。嵌入模型决定了哪些文档会被送进生成模型,检索错了,后面的生成再强也补不回来。
可用性与限制
- 可用渠道:官方称 Embed 5 当日正式可用,渠道包括 Cohere API、Model Vault、Microsoft Foundry 与 Amazon SageMaker,也可在 North 平台内直接使用。
- 私有部署:官方称两个档位都可以用 vLLM 自托管,批量嵌入(batch embedding)用于大规模入库;具体配额、并发与速率限制以官方文档为准。
- 价格:官方博客给出了按 token 计价的档位划分,本文不写死数字,具体价格以 Cohere 官网定价页为准。
- 输出维度:可选 256 / 512 / 768 / 1024 / 1536 / 2048,输出格式支持 float、int8 与 binary;维度与格式的可用组合以官方文档为准。
- 跨档位检索的前提:Pro 与 Fast 混用时两侧需使用相同的输出维度。官方称在 Matryoshka 截断与 int8 量化下同样成立,但自建向量库的相似度配置需自行验证。
- 境内访问:Cohere 官方服务在境内的可达性与合规要求未在本公告中说明;接入前请以官网与所用云平台渠道的实际说明为准。
主要功能
- 用 Pro 建立离线索引,用 Fast 承接在线查询,同一份向量可复用
- 嵌入文本、图像,以及文本与图像融合的输入(如 PDF 页面)
- 覆盖 100 种以上语言的检索
- 提供 128K token 上下文窗口,处理长文档
- 用 Matryoshka 表示压缩向量维度以节省存储
- 输出 float / int8 / binary 三种格式,按存储与精度取舍
技术原理
据官方说明,Embed 5 是一个把文档与查询映射到同一向量空间的编码器:语义相近的内容在空间中距离更近,检索就是比距离。Pro 与 Fast 共享嵌入空间,是这次能在两侧分别选模型的前提——如果两套模型的向量空间不一致,跨模型比较距离就没有意义。
Matryoshka 表示指的是一个高维向量的前若干维本身就是可用的低维向量,因此可以只存前 256 维或 512 维来换存储,代价是精度。int8 与 binary 输出是另一种压缩路径,用更低精度换更小的索引体积。
评测方法上,官方称 Embed 5 是其首个采用 RCP-nDCG@10 这一检索评测方法的模型家族:不同于只对固定标签计分,它按查询相关的判定标准给召回文档打分。官方在博客中给出了多组对比数据,本文不转述具体分数,请以官方博客原文为准。
实际体验
想验证「共享嵌入空间」这件事是否真的可用,可以用官方 API 做一个最小实验,步骤是可复现的:
第一步,准备一小批自有文档(几十条即可,建议故意混入表格页、扫描件和多语言内容),用 embed-v5.0-pro 以 output_dimension 取 1024 建索引。
第二步,用同一个查询集分别跑 embed-v5.0-pro 与 embed-v5.0-fast 两种查询嵌入,比较召回结果排序的重合度。官方给出的口径是跨模型组合接近同模型基线,但具体到你的语料上是多少,只能自己测。
第三步,把 output_dimension 从 2048 降到 256,观察召回质量与索引体积的变化;再切到 int8 与 binary 看一次。这一步决定你实际要付多少存储成本。
需要自备 Cohere API key,网络与计费以官网为准。
项目地址与获取方式
Embed 5 是托管服务,官方公告中未提供开源仓库,仅通过官方渠道获取。入口是 Cohere 官网创建 API key,随后在 API、Model Vault、Microsoft Foundry 或 Amazon SageMaker 调用;私有部署按官方说明用 vLLM 自建。文档见 docs.cohere.com。请通过官方渠道获取,避免安装被篡改的版本。
适合谁用
- 已有向量库、想在不重建索引的前提下降低在线查询延迟的检索系统负责人
- 处理财报、合同、说明书这类版式复杂文档的企业搜索与 RAG 团队
- 需要覆盖多语言语料、又希望索引与查询成本分开控制的团队
- 做智能体流程、一次任务里要发几十次检索的开发者
不必用的情况:语料规模很小、纯文本、检索质量已经够用,那么换嵌入模型的收益有限,反而要承担重建索引的验证成本;只做生成不做检索的场景也用不到它。
常见问题
Embed 5 和上一代 Embed 4 是什么关系?
官方定位 Embed 5 是新一代嵌入模型家族,官方称其在版式复杂文档、财报、解析后 PDF、代码和多语言检索上相较 Embed 4 有明显提升。官方博客给出了分项对比数据,具体数值请以官方原文为准。是否值得替换,建议拿自有语料跑一次召回对比再决定。
Pro 和 Fast 该怎么选?
官方给出的建议是索引用 Pro、查询用 Fast:建库是一次性成本,质量值得投入;查询是每次请求都要付的延迟与费用,用轻一点的档位更划算。如果你的查询量很低、或语料短小,全用 Pro 也可以。
换到 Embed 5 需要重建向量库吗?
从其他嵌入模型迁到 Embed 5 需要重新生成向量,因为不同模型族的向量空间不可直接比较。但在 Embed 5 内部,Pro 与 Fast 共享同一空间,所以两档之间切换不需要重建。
可以自己部署吗?
官方称两个档位都支持用 vLLM 自托管,也提供 Model Vault 用于单租户部署。具体的部署方式、支持的硬件与许可条件以官方文档为准。
图像的嵌入怎么计费?
官方博客对文本与图像分别列出了计价口径,本文不写死数字。图像嵌入的单价与文本不同,具体以 Cohere 官网定价页为准。
相关工具与内容
- /category/search — AI 搜索分类,检索与知识发现相关工具
- /category/agent — AI 智能体分类,检索是智能体流程的常见前置环节
- /tool/dify — 可自建工作流与知识库的智能体平台,检索配置是核心环节
- /tool/metaso — AI 搜索工具,可对照看检索层的效果差异
- /tool/notebooklm — 基于自有资料问答的工具,适合观察检索质量
- /article/ai-tools-selection-q4-2026 — 若你在做工具选型,可参考这篇的整体思路
相关内容
DeepSeek 把内核栈开源到昇腾:DeepGEMM-Ascend 首发,FlashMLA 新增 Ascend 950 支持
2026 年 9 月 30 日,DeepSeek 在 GitHub 上公开 deepseek-ai/DeepGEMM-Ascend 仓库,README 的 News 段标注 2026.09.30 首发、支持 Ascend 950 设备;同日 FlashMLA 合并了标题为 Ascend 950 开源版本的 PR,新增昇腾 NPU 的稀疏注意力 prefill 与解码内核,支持范围收窄到 DeepSeek-V4.1。
Manus Flex 上线:自带推理服务商的 API 密钥,模型你自己选,智能体它来跑
Manus 于 2026 年 9 月 29 日发布官方博客,推出 Manus Flex 模块:用户可在 Manus 工作区接入受支持推理服务商的自有 API 密钥,模型推理由该服务商直接计费,Manus 继续负责规划、工具与执行环境。首批推理合作伙伴为 OpenRouter、Fireworks 与 Modal。
Transformers v5.18.0 发布:新增说话人日志与多模态推理模型,附数项破坏性变更
Hugging Face 于 2026 年 9 月 30 日发布 Transformers v5.18.0(非预发布)。本版新增四个模型支持:NVIDIA 的 Nemotron 3 Diarization 说话人日志模型与 NemotronH Omni 多模态推理模型、NAVER 的 HyperCLOVAX Vision V2 视觉语言模型,以及 GTE 文本表示模型;同时包含数项破坏性变更。