Google DeepMind 于 2026 年 10 月 6 日正式发布 EmbeddingGemma 2这是继去年 EmbeddingGemma 之后的新一代开放嵌入模型。官方数据显示初代 EmbeddingGemma 下载量已超过 2000 万次被广泛用于端侧搜索与隐私优先的 RAG 流水线。EmbeddingGemma 2 在此基础上将能力从纯文本扩展到代码、图像、视频和音频并采用 Apache 2.0 商业友好许可。架构与多模态对齐机制EmbeddingGemma 2 基于 Gemma 4 架构构建总参数量 740M。其核心设计是模块化文本工作负载最低只需 270M 参数视觉编码器可选增加 170M音频编码器可选增加 300M。这种设计意味着开发者可以按需组合而非强制加载完整多模态权重。模型原生将文本、图像、音频、视频的组合映射到统一嵌入空间。官方描述其与 Gemini Embedding 系列共享底层技术并复用 Gemma 4 的文本 tokenizer 和音频编码器。这一共享机制带来一个关键工程收益当 EmbeddingGemma 2 与 Gemma 4 生成模型配合部署时两者可在统一流水线中运行降低合计内存占用。轻量化与存储优化EmbeddingGemma 2 采用 Matryoshka Representation LearningMRL输出向量可从 768 维动态截断至 512、256 或 128 维。官方称此举可为本地向量数据库和内存使用带来最高 6 倍的存储缩减。对于端侧向量检索场景这意味着开发者可以在召回率与存储成本之间做连续调节而不必更换模型。端侧性能方面官方给出 Google Pixel 11 Pro 上的量化数据纯文本权重活跃内存约 191MB完整多模态模型约 567MB。上下文窗口为 8K token是初代的 4 倍可处理约 5.5 分钟音频、29 张图像、58 个视频帧或它们的交错组合。基准表现官方公布的评测结果显示EmbeddingGemma 2 在 sub-1B 多模态嵌入模型中处于领先位置。文本方面延续了初代的多语言能力代码方面在 MTEB Code 上从 68.76 提升至 78.68提升 9.92 分官方定位其适用于本地代码库索引、语义代码搜索和编码 agent 检索。在图像、视频、文档和音频任务上官方称其质量-参数比优于同规模模型甚至超过部分参数量两倍以上的专用模型。完整评测指标见官方 model card。端侧 RAG 与隐私部署EmbeddingGemma 2 的定位是让语义搜索、路由和检索完全在边缘硬件上运行。本地生成嵌入可减少数据外传、降低流水线延迟并支持完全离线的跨模态搜索。官方给出的典型场景包括从语音备忘录中定位特定视频片段或基于文本查询检索数小时音频记录。部署路径方面官方与多方合作提供了较完整的工具链模型权重发布于 Hugging Face 和 KaggleGemini Enterprise Agent Platform Model Garden 即将上线端侧可通过 Google AI Edge 的 MediaPipe 或 LiteRT 集成浏览器端支持 transformers.js 与 WebGPU服务端可用 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio向量存储方面官方提及 Qdrant。微调可参考 Unsloth 的指南。选型建议与边界从工程视角看EmbeddingGemma 2 的差异化在于三点一是原生多模态统一嵌入空间避免为不同模态维护多套检索索引二是模块化参数设计文本场景可只加载 270M 部分三是 MRL 带来的向量维度弹性。但需注意官方资料未披露各模态编码器的具体对齐训练细节、量化方案的具体类型以及不同维度截断下的召回率衰减曲线。实际选型时建议在目标硬件上以真实业务数据验证 128/256/512 维截断后的检索质量并确认所选推理框架对多模态输入的支持程度。对于纯文本 RAG初代 EmbeddingGemma 或更小模型可能仍是更经济的选项当业务涉及音频、视频或代码混合检索时EmbeddingGemma 2 的统一嵌入空间才体现出结构性优势。