EmbeddingGemma 2:开源、轻量的多模态嵌入模型 2026 年 10 月 6 日
作者:Sahil Dua(Google DeepMind 研究工程师)、Henrique Schechter Vera(Google DeepMind 研究工程师)
EmbeddingGemma 2 是目前用于端侧多模态嵌入能力最强的模型,可将文本、图像、音频和视频的组合原生映射到统一的嵌入空间。
我们去年推出 EmbeddingGemma,是为了提供一种轻量级的高质量文本嵌入方案,帮助应用在消费级硬件上直接组织、搜索和连接信息。开发者社区的反馈远超我们的预期:下载量超过 2000 万次,开发者用它构建了更智能的端侧搜索工具和隐私优先的检索增强生成(RAG)流程。
今天,我们发布 EmbeddingGemma 2,把能力从文本扩展到代码、图像、视频和音频,并统一在同一个嵌入空间中。它基于 Gemma 4 架构构建,采用允许商业使用的 Apache 2.0 许可证,拥有 7.4 亿参数,非常适合端侧推理。它可以从一条语音备忘录中找出特定视频片段,也可以根据文本查询检索数小时的音频录音,而这一切都由单一的、原生多模态的模型在本地完成。
EmbeddingGemma 2 与 Gemini Embedding 系列模型采用相同技术构建,具备以下特点:
- 同尺寸中表现最佳:在 MTEB Code(大规模文本嵌入基准)和 MAEB(大规模音频嵌入基准)等评测中,于 10 亿参数以下的多模态嵌入模型中取得同尺寸领先成绩,同时在文本、视觉和音频任务上达到或超过许多更大的模型。 - 模块化设计:仅需 270M 参数即可支持纯文本工作负载,并可选配视觉(170M)和音频(300M)编码器以提供完整的多模态支持。 - 存储高效:借助 Matryoshka 表示学习(MRL),开发者可将输出向量从 768 维动态截断至 512、256 或 128 维,从而使本地向量数据库的存储与内存占用最多减少 6 倍。 - 针对端侧性能优化:可在紧张的资源约束下高效运行。经过量化后,在一台 Google Pixel 11 Pro 上,EmbeddingGemma 2 的纯文本权重仅需约 191MB 活动内存,完整多模态模型约需 567MB。 - 支持扩展上下文:具备 8K token 上下文窗口(是 EmbeddingGemma 1 的 4 倍),可在本地硬件上直接处理最长约 5.5 分钟的音频、29 张图像、58 帧视频,或它们的交错组合。
在代码、视觉和音频上达到顶级质量
EmbeddingGemma 2 延续了 EmbeddingGemma 强大的多语言文本表现,同时在代码性能上实现了 9.92 分的显著提升(MTEB Code 从 68.76 提升至 78.68),非常适合本地代码库索引、语义代码搜索和编码智能体检索。在图像、视频、文档和音频方面,它为 10 亿参数以下的模型树立了“单位参数质量”的新标准,甚至超过了一些参数量是其两倍以上的专用模型。完整的评测指标和模型信息可在 EmbeddingGemma 2 模型卡中查看。
完全在设备端实现语义搜索、路由与检索
EmbeddingGemma 2 将强大的能力直接带到边缘硬件上。在本地生成嵌入有助于保障数据隐私、降低流水线延迟,并让开发者能够构建完全离线运行的跨模态搜索与检索。与 Gemma 4 等生成式模型配合使用时,EmbeddingGemma 2 可支撑端侧 RAG 流程,理解复杂的多模态数据。由于 EmbeddingGemma 2 基于 Gemma 4 构建,并共用其文本分词器和音频编码器,开发者可以在统一流水线中同时运行两个模型,并降低合计内存占用。
- 用文本或图像,按语义相似度在你的媒体库中找到最匹配的内容。可在 Google AI Edge Gallery 的 Instant Media Search 中试用。 - 用文本或音频查询定位视频中的特定片段。可在 Google AI Edge Gallery 的 Video Moments Finder 中试用。 - 将 EmbeddingGemma 2 用于本地文件检索,与 Gemma 4 的上下文推理能力搭配使用。可在 Google AI Edge Foresight 应用中试用。 - 通过 MediaPipe Decision Task API,利用多模态上下文构建实时决策引擎,用于分类、路由和预测。
如需了解如何用 LiteRT 构建端侧搜索和 RAG 系统,请阅读 Google AI Edge 博客文章。
开始使用 EmbeddingGemma 2
我们与以下合作伙伴紧密协作,确保 EmbeddingGemma 2 能在你的开发环境中即刻可用:
- 下载模型:可在 Hugging Face 和 Kaggle 上找到模型权重,Gemini Enterprise Agent Platform Model Garden 稍后也将提供。想获取针对端侧优化的模型,可访问 Hugging Face 上的 LiteRT 社区。 - 端侧部署:使用 Google AI Edge MediaPipe 开发跨平台应用,获得开箱即用的嵌入、检索和决策任务能力;或使用 LiteRT 进行自定义模型集成。也可通过 transformers.js 或 WebGPU 面向浏览器构建。 - 使用你熟悉的开发工具:可用 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 高效地服务该模型。用 Qdrant 存储嵌入向量。 - 微调:参考 Unsloth 的指南,了解如何针对你的用例微调 EmbeddingGemma 2。
欢迎查阅我们的开发者指南、文档,以及推理与微调指南。