Cohere 发布 Embed 5:Pro 与 Fast 共享同一个向量空间,索引和查询可以分开选

Cohere 于 2026 年 9 月 30 日发布 Embed 5 嵌入模型家族,含 Pro 与 Fast 两档,模型名为 embed-v5.0-pro 与 embed-v5.0-fast。两档共享同一个嵌入空间,可用 Pro 建索引、用 Fast 承接在线查询而无需重建向量库。支持文本与图像输入、100 多种语言、128K token 上下文与多档输出维度。

这次发布的是什么

Cohere 于 2026 年 9 月 30 日发布 Embed 5,一个新的嵌入模型家族,包含 Embed 5 Pro 与 Embed 5 Fast 两个档位,官方 API 中的模型名分别为 embed-v5.0-pro 与 embed-v5.0-fast。官方公告页为 Cohere 博客的「Introducing Embed 5」,页面标注日期 Sep 30, 2026;开发者文档侧的 changelog 页同步上线了对应条目。

这次发布里最值得注意的是一个结构上的设计:Pro 与 Fast 共享同一个嵌入空间。官方的说明是,用其中一个模型建的索引,可以直接用另一个模型去查询,不需要重建向量库;官方推荐的搭配是用 Pro 做离线索引、用 Fast 承接在线查询。这意味着「建库质量」和「查询延迟」第一次可以在同一个索引上分别取舍。

影响谁:做企业搜索、RAG(检索增强生成)和智能体检索的团队。嵌入模型决定了哪些文档会被送进生成模型,检索错了,后面的生成再强也补不回来。

可用性与限制

  • 可用渠道:官方称 Embed 5 当日正式可用,渠道包括 Cohere API、Model Vault、Microsoft Foundry 与 Amazon SageMaker,也可在 North 平台内直接使用。
  • 私有部署:官方称两个档位都可以用 vLLM 自托管,批量嵌入(batch embedding)用于大规模入库;具体配额、并发与速率限制以官方文档为准。
  • 价格:官方博客给出了按 token 计价的档位划分,本文不写死数字,具体价格以 Cohere 官网定价页为准。
  • 输出维度:可选 256 / 512 / 768 / 1024 / 1536 / 2048,输出格式支持 float、int8 与 binary;维度与格式的可用组合以官方文档为准。
  • 跨档位检索的前提:Pro 与 Fast 混用时两侧需使用相同的输出维度。官方称在 Matryoshka 截断与 int8 量化下同样成立,但自建向量库的相似度配置需自行验证。
  • 境内访问:Cohere 官方服务在境内的可达性与合规要求未在本公告中说明;接入前请以官网与所用云平台渠道的实际说明为准。

主要功能

  • 用 Pro 建立离线索引,用 Fast 承接在线查询,同一份向量可复用
  • 嵌入文本、图像,以及文本与图像融合的输入(如 PDF 页面)
  • 覆盖 100 种以上语言的检索
  • 提供 128K token 上下文窗口,处理长文档
  • 用 Matryoshka 表示压缩向量维度以节省存储
  • 输出 float / int8 / binary 三种格式,按存储与精度取舍

技术原理

据官方说明,Embed 5 是一个把文档与查询映射到同一向量空间的编码器:语义相近的内容在空间中距离更近,检索就是比距离。Pro 与 Fast 共享嵌入空间,是这次能在两侧分别选模型的前提——如果两套模型的向量空间不一致,跨模型比较距离就没有意义。

Matryoshka 表示指的是一个高维向量的前若干维本身就是可用的低维向量,因此可以只存前 256 维或 512 维来换存储,代价是精度。int8 与 binary 输出是另一种压缩路径,用更低精度换更小的索引体积。

评测方法上,官方称 Embed 5 是其首个采用 RCP-nDCG@10 这一检索评测方法的模型家族:不同于只对固定标签计分,它按查询相关的判定标准给召回文档打分。官方在博客中给出了多组对比数据,本文不转述具体分数,请以官方博客原文为准。

实际体验

想验证「共享嵌入空间」这件事是否真的可用,可以用官方 API 做一个最小实验,步骤是可复现的:

第一步,准备一小批自有文档(几十条即可,建议故意混入表格页、扫描件和多语言内容),用 embed-v5.0-pro 以 output_dimension 取 1024 建索引。

第二步,用同一个查询集分别跑 embed-v5.0-pro 与 embed-v5.0-fast 两种查询嵌入,比较召回结果排序的重合度。官方给出的口径是跨模型组合接近同模型基线,但具体到你的语料上是多少,只能自己测。

第三步,把 output_dimension 从 2048 降到 256,观察召回质量与索引体积的变化;再切到 int8 与 binary 看一次。这一步决定你实际要付多少存储成本。

需要自备 Cohere API key,网络与计费以官网为准。

项目地址与获取方式

Embed 5 是托管服务,官方公告中未提供开源仓库,仅通过官方渠道获取。入口是 Cohere 官网创建 API key,随后在 API、Model Vault、Microsoft Foundry 或 Amazon SageMaker 调用;私有部署按官方说明用 vLLM 自建。文档见 docs.cohere.com。请通过官方渠道获取,避免安装被篡改的版本。

适合谁用

  • 已有向量库、想在不重建索引的前提下降低在线查询延迟的检索系统负责人
  • 处理财报、合同、说明书这类版式复杂文档的企业搜索与 RAG 团队
  • 需要覆盖多语言语料、又希望索引与查询成本分开控制的团队
  • 做智能体流程、一次任务里要发几十次检索的开发者

不必用的情况:语料规模很小、纯文本、检索质量已经够用,那么换嵌入模型的收益有限,反而要承担重建索引的验证成本;只做生成不做检索的场景也用不到它。

常见问题

Embed 5 和上一代 Embed 4 是什么关系?

官方定位 Embed 5 是新一代嵌入模型家族,官方称其在版式复杂文档、财报、解析后 PDF、代码和多语言检索上相较 Embed 4 有明显提升。官方博客给出了分项对比数据,具体数值请以官方原文为准。是否值得替换,建议拿自有语料跑一次召回对比再决定。

Pro 和 Fast 该怎么选?

官方给出的建议是索引用 Pro、查询用 Fast:建库是一次性成本,质量值得投入;查询是每次请求都要付的延迟与费用,用轻一点的档位更划算。如果你的查询量很低、或语料短小,全用 Pro 也可以。

换到 Embed 5 需要重建向量库吗?

从其他嵌入模型迁到 Embed 5 需要重新生成向量,因为不同模型族的向量空间不可直接比较。但在 Embed 5 内部,Pro 与 Fast 共享同一空间,所以两档之间切换不需要重建。

可以自己部署吗?

官方称两个档位都支持用 vLLM 自托管,也提供 Model Vault 用于单租户部署。具体的部署方式、支持的硬件与许可条件以官方文档为准。

图像的嵌入怎么计费?

官方博客对文本与图像分别列出了计价口径,本文不写死数字。图像嵌入的单价与文本不同,具体以 Cohere 官网定价页为准。

相关工具与内容

  • /category/search — AI 搜索分类,检索与知识发现相关工具
  • /category/agent — AI 智能体分类,检索是智能体流程的常见前置环节
  • /tool/dify — 可自建工作流与知识库的智能体平台,检索配置是核心环节
  • /tool/metaso — AI 搜索工具,可对照看检索层的效果差异
  • /tool/notebooklm — 基于自有资料问答的工具,适合观察检索质量
  • /article/ai-tools-selection-q4-2026 — 若你在做工具选型,可参考这篇的整体思路
Related
链接已复制