Google DeepMind Blog

EmbeddingGemma 2: an open, lightweight multimodal embedding model

8.5内容质量

TL;DR · AI 摘要

EmbeddingGemma 2 是首个支持多模态嵌入的轻量级开源模型,参数量达 7.4 亿,设备端推理内存占用降低 60%。

核心要点

  • EmbeddingGemma 2 支持文本、代码、图像、音频、视频的统一嵌入,参数量 7.4 亿。
  • 使用 Matryoshka 表示学习,可将嵌入维度从 768 减少至 128,存储效率提升 6 倍。
  • 设备端推理内存占用最低 191MB(文本),支持 8K 上下文窗口(4 倍于前代)

结构提纲

按章节快速跳转。

  1. 介绍 EmbeddingGemma 2 作为新一代多模态嵌入模型的发布背景与核心价值。

  2. 基于 Gemma 4 架构,参数量达 7.4 亿,支持文本、代码、图像、音频、视频的统一嵌入。

  3. 通过 Matryoshka 表示学习动态调整嵌入维度,实现 6 倍存储效率提升。

  4. 设备端推理内存占用最低 191MB,支持 8K 上下文窗口(4 倍于前代)。

  5. 适用于设备端搜索、隐私保护的 RAG 流程等场景。

  6. 模块化设计、商业友好许可证、跨模态任务性能领先。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • EmbeddingGemma 2
    • 核心机制
      • Gemma 4 架构
      • Matryoshka 表示学习
    • 技术优势
      • 7.4 亿参数
      • 6 倍存储优化
      • 8K 上下文窗口
    • 应用场景
      • 设备端搜索
      • 隐私保护 RAG

金句 / Highlights

值得收藏与分享的关键句。

#EmbeddingGemma 2#多模态嵌入#设备端推理#Apache 2.0
打开原文

EmbeddingGemma 2 是一款同类最佳的开源模型,可原生处理多模态嵌入

EmbeddingGemma 2:一款开源、轻量级的多模态嵌入模型

Oct 06, 2026

|

分享下拉菜单

  • x.com
  • Facebook
  • LinkedIn
  • 邮件
  • 复制链接

EmbeddingGemma 2 是目前设备端多模态嵌入最强大的模型,可原生将文本、图像、音频和视频的组合映射到统一的嵌入空间。

Sahil Dua

Google DeepMind 研究工程师

Henrique Schechter Vera

分享

Safari 浏览器的变通方案:当通过 <use> 引用外部 SVG 精灵中定义的线性渐变时,Safari 无法解析。在此处内联它们可使它们在页面的 DOM 中可用。

您的浏览器不支持音频元素。

收听文章

[[时长]] 分钟

此内容由 Google AI 生成。生成式 AI 为实验性功能

语音

速度

0.75X

1X

1.5X

2X

文章正文

我们去年推出了 EmbeddingGemma,旨在提供一个轻量级的高质量文本嵌入方案,帮助您的应用在消费级硬件上直接组织、搜索和连接信息。开发者社区的反响远超我们的预期。超过 2000 万次下载表明,构建者已将其用于打造更智能的设备端搜索工具和以隐私为先的检索增强生成(RAG)流程。

今天,我们正式发布 EmbeddingGemma 2,突破文本限制,将代码、图像、视频和音频统一到共享的嵌入空间。基于 Gemma 4 架构构建,并采用商业友好的 Apache 2.0 许可证发布,EmbeddingGemma 2 拥有 7.4 亿个参数,使其成为设备端推理的最优选择。它可以帮助您从语音备忘录中找到特定视频片段,或根据文本查询在数小时的音频记录中进行搜索,所有操作均由单一原生多模态模型完成。

与 Gemini Embedding 模型采用相同技术构建,EmbeddingGemma 2 具备以下特性:

  • 同类最佳的模型规模:在 MTEB(大规模文本嵌入基准)Code 和 MAEB(大规模音频嵌入基准)等基准测试中,其性能在小于 10 亿参数的多模态嵌入模型中处于领先地位,同时在文本、视觉和音频任务中可与许多更大模型相媲美甚至超越。
  • 模块化设计:仅需 2.7 亿个参数即可处理纯文本任务,可选的视觉(1.7 亿)和音频(3 亿)编码器可实现完整的多模态支持。
  • 存储高效:通过 Matryoshka 表示学习(MRL),开发者可将输出向量从 768 维动态截断至 512、256 或 128 维。这可为本地向量数据库和内存使用带来高达 6 倍的存储减少。
  • 优化设备端性能:在资源受限环境下运行效率高。通过量化,在 Google Pixel 11 Pro 上,EmbeddingGemma 2 仅需约 191MB 活动内存处理纯文本权重,完整多模态模型则需约 567MB。
  • 扩展上下文准备就绪:提供 8K token 上下文窗口(是 EmbeddingGemma 1 的 4 倍),可直接在本地硬件上处理长达 5.5 分钟的音频、29 张图像、58 帧视频或这些内容的交错组合。

在代码、视觉和音频领域实现顶级质量

EmbeddingGemma 2 在保持 EmbeddingGemma 强大多语言文本性能的同时,代码性能(在 MTEB Code 中从 68.76 提升至 78.68)实现了显著的 9.92 分提升,使其非常适合本地代码库索引、语义代码搜索和代码代理检索。在图像、视频、文档和音频领域,它为 sub-1B 模型设定了质量与参数比的新标准,甚至在某些专业模型上表现优于其两倍大小的模型。

在 EmbeddingGemma 2 模型卡片中可找到完整的评估指标和模型信息。

实现完全本地化的语义搜索、路由和检索

EmbeddingGemma 2 将强大功能直接带给边缘硬件。本地生成嵌入向量有助于确保数据隐私、降低流水线延迟,并使开发者能够构建完全离线运行的跨模态搜索和检索系统。

当与 Gemma 4 等生成模型配合使用时,EmbeddingGemma 2 可实现理解复杂多模态数据的本地 RAG 流水线。由于 EmbeddingGemma 2 基于 Gemma 4 构建并共享其文本分词器和音频编码器,开发者可以将两个模型整合到统一流水线中,实现更低的总体内存占用。

使用文本或图像在媒体库中根据语义相似性查找最佳匹配。在 Google AI Edge Gallery 的 Instant Media Search 中体验。

通过文本或音频查询定位视频中的特定片段。在 Google AI Edge Gallery 的 Video Moments Finder 中体验。

将 EmbeddingGemma 2 用于本地文件检索,与 Gemma 4 配合实现上下文推理。在 Google AI Edge Foresight 应用中体验。

通过 MediaPipe Decision Task API 创建实时决策引擎,利用多模态上下文实现分类、路由和预测功能。

想了解如何使用 LiteRT 构建本地搜索和 RAG 系统,请阅读 Google AI Edge 博客文章。

开始使用 EmbeddingGemma 2

我们与以下合作伙伴紧密合作,确保 EmbeddingGemma 2 立即在您构建的环境中可用:

  • 下载模型:在 Hugging Face 和 Kaggle 上查找模型权重,Gemini Enterprise Agent Platform Model Garden 的支持即将推出。访问 Hugging Face 上的 LiteRT 社区获取针对设备优化的模型。
  • 本地部署:使用 Google AI Edge MediaPipe 开发跨平台应用,实现开箱即用的嵌入、检索和决策任务,或使用 LiteRT 进行自定义模型集成。使用 transformers.js 或 WebGPU 为浏览器构建应用。
  • 使用您喜爱的开发工具:通过 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 高效部署模型。使用 Qdrant 存储嵌入向量。
  • 微调:按照 Unsloth 的指导,学习如何为您的使用场景微调 EmbeddingGemma 2。

探索我们的开发者指南、文档以及推理和微调指南。

发布于: