">

EmbeddingGemma 2 发布:7.4 亿参数的端侧多模态嵌入模型,文本、图像、音频、视频共用一个向量空间

Google DeepMind 于 2026 年 10 月 6 日在官方博客发布 EmbeddingGemma 2,把上一代的纯文本嵌入扩展到代码、图像、视频与音频,统一映射到同一个嵌入空间。模型基于 Gemma 4 架构、7.4 亿参数、Apache 2.0 许可,面向手机与浏览器等端侧场景,官方称其支持可裁剪的模块化编码器与 Matryoshka 向量降维。

这次发布的是什么

Google DeepMind 于 2026 年 10 月 6 日在 Google 官方博客发布 EmbeddingGemma 2 —— 一个把文本、代码、图像、视频与音频统一映射到同一个嵌入空间的轻量级模型。上一代 EmbeddingGemma 发布于 2025 年,只做文本嵌入;这一代基于 Gemma 4 架构,参数量为 7.4 亿,采用 Apache 2.0 许可,官方给出的定位是面向端侧推理。官方博客由 Google DeepMind 的研究工程师 Sahil Dua 与 Henrique Schechter Vera 署名,文中称其在同尺寸区间的多模态嵌入模型中表现领先。对做本地检索、跨模态搜索与端侧 RAG 的开发者来说,这是把「多模态检索」从云端搬到设备上的一次基础设施更新。

可用性与限制

  • 许可:Apache 2.0,官方表述为商业友好;具体使用条款以官方模型卡与许可文件为准。
  • 获取渠道:官方称权重已在 Hugging Face 与 Kaggle 提供,Gemini Enterprise Agent Platform 的 Model Garden 支持标注为「coming soon」,实际开放时间以官方页面为准。
  • 硬件前提:官方给的内存占用参考来自 Google Pixel 11 Pro 上的量化运行,其他设备的实际占用以实测为准。
  • 能力边界:它是嵌入模型,不生成内容;要与生成模型配合(官方示例为搭配 Gemma 4 做端侧 RAG)。
  • 中国内地访问:Hugging Face 与 Kaggle 的网络可达性因环境而异,请以你的网络条件与官方渠道说明为准。

主要功能

  • 把文本、代码、图像、视频、音频统一映射到同一个嵌入空间,支持跨模态检索。
  • 模块化组合:纯文本场景可只用文本编码器,按需叠加视觉与音频编码器。
  • 用 Matryoshka 表征学习把输出向量从 768 维裁剪到 512 / 256 / 128 维,降低向量库存储。
  • 提供 8K token 上下文,官方称可处理数分钟音频、数十张图像或数十帧视频。
  • 与 Gemma 4 共用文本分词器与音频编码器,便于两个模型在同一条流水线里共存。
  • 官方列出的调用方式覆盖 MediaPipe、LiteRT、transformers.js、以及 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudio 等。

技术原理

据官方说明,EmbeddingGemma 2 建在 Gemma 4 之上,与 Gemini Embedding 系列同源,因此天然支持多模态输入:不同模态经各自的编码器进入同一个向量空间,使「用一句话找一段视频片段」这类跨模态查询变成一次向量近邻检索。模型被拆成了可组合的模块——纯文本任务只需要文本编码器,需要视觉或音频时再加载对应编码器,这样在只做文本检索的设备上就不必为多模态付出全部内存。向量降维依托 Matryoshka 表征学习:训练时让向量的前若干维就具备完整语义,推理时便可按需截断到 512、256 或 128 维,官方称这为本地向量库带来可观的存储节省。此外,官方提到在代码检索类评测上相较上一代有明显提升,具体分数以官方模型卡为准,本文不转述未核实的数字。

实际体验

可复现的验证步骤:先从 Hugging Face 的官方仓库(或 LiteRT Community 提供的端侧优化版本)按官方说明拉取权重;用官方给出的示例跑一组纯文本检索,记录内存占用与延迟,再叠加视觉编码器重复一次,观察增量开销;随后把输出维度分别设为 768 与 128,对比向量库体积变化与召回质量的变化,决定你的场景能接受哪一档裁剪。端侧部署建议优先走 MediaPipe 或 LiteRT 的现成任务接口,浏览器场景可试 transformers.js 与 WebGPU。

项目地址与获取方式

官方公告与模型卡入口:https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/ 。权重按官方说明在 Hugging Face 与 Kaggle 获取,端侧优化版在 LiteRT Community。请通过官方渠道获取,避免安装被篡改的版本。

适合谁用

  • 做端侧检索、本地知识库与隐私优先 RAG 的开发者,尤其是不希望数据出设备的场景。
  • 需要跨模态搜索的产品团队:用文字找视频片段、用语音备忘录找图片这类需求。
  • 在手机或浏览器上做语义路由、分类与实时决策的边缘计算场景。
  • 什么人不必用:只在云端调用现成检索 API、且不涉及端侧或隐私约束的团队,短期收益有限。

常见问题

EmbeddingGemma 2 和上一代是什么关系?

是 EmbeddingGemma 的升级版:上一代只做文本嵌入,这一代基于 Gemma 4 架构扩展到代码、图像、视频与音频,并加入了模块化编码器与可裁剪的向量维度。官方定位是端侧多模态嵌入。

它的许可能不能商用?

官方博客写明采用 Apache 2.0 许可,并称之为商业友好。具体到你的使用场景,仍以官方模型卡与许可文件的条款为准,本文不替代法务判断。

普通开发者上手需要多少成本?

官方给出了端侧的内存占用参考(纯文本与全模态两档,基于 Pixel 11 Pro 的量化运行),实际开销取决于设备与所选模块。建议先用纯文本路径跑通,再按需叠加视觉与音频编码器。

它能不能直接生成内容?

不能。它是嵌入模型,只负责把输入映射成向量,用于检索、路由与相似度计算;生成部分需要另配生成模型,官方示例是搭配 Gemma 4 组成端侧 RAG 流水线。

相关工具与内容

Related
快讯 1 小时前

Anthropic 扩展 Cyber Verification Program:把高级网络能力按三档开放给经审核的安全团队

Anthropic 于 2026 年 10 月 6 日宣布扩展其 Cyber Verification Program(CVP),把过去分别运行的 Project Glasswing 与 CVP 合并为一个三档访问的计划:Defense Access、Red Team Access 与 Specialized Access。通过审核的安全团队可获得拦截更少、网络能力更强的 Claude 模型访问权限,官方同时公布了分层拦截效果的评估结论。

前沿快讯 1 阅读
快讯 1 小时前

Diffusers v0.41.0 发布:接入 Qwen-Image 2.1,并改用围绕新模型的发版节奏

Hugging Face 的扩散模型库 Diffusers 于 2026 年 10 月 6 日发布 v0.41.0,主线是把 Qwen-Image 2.1 接入 Diffusers,支持文生图、图像编辑、原生透明通道与 LoRA 训练。官方同时宣布改用与 Transformers 一致的发版策略:次版本围绕新模型集成组织,补丁版本只做修复。

前沿快讯 2 阅读

继续阅读:Anthropic 扩展 Cyber Verification Program:把高级网络能力按三档开放给经审核的安全团队 · ComfyUI v0.39.0 发布:新增离线与关闭合作节点开关,一批第三方模型节点同步上线

关于本文:本站文章由编辑部独立撰写,评测口径与免责说明见关于我们。想继续找工具,可从分类导航按场景浏览,或回首页搜索。

链接已复制