谷歌开源 EmbeddingGemma 2 多模态嵌入模型,可端侧运行
谷歌 10 月 6 日发布 7.4 亿参数开放权重多模态嵌入模型 EmbeddingGemma 2,统一文本、代码、图像、视频、音频于同一向量空间,可端侧运行,代码检索基准提升 9.92 分。
谷歌于 10 月 6 日发布 EmbeddingGemma 2,这是一款 7.4 亿参数的开放权重多模态嵌入模型,基于 Gemma 4 架构,采用 Apache 2.0 许可,可在手机等消费级硬件上本地运行。
它将文本、代码、图像、视频和音频统一映射到同一个 768 维向量空间。模型由三个可独立加载的编码器组成——2.7 亿参数的文本核心、1.7 亿参数的视觉编码器和 3 亿参数的音频编码器,开发者可按需组合,最小仅加载 2.7 亿参数即可处理文本与代码。上下文窗口为 8K token,是上一代的 4 倍,单次输入最多容纳 29 张图像、58 帧视频或约 5.5 分钟音频。在代码检索基准 MTEB Code 上,得分从 68.76 提升至 78.68,提高 9.92 分。借助 Matryoshka 表示学习,输出向量可从 768 维截断至 128 维,向量库存储最多节省 6 倍;量化后,在 Pixel 11 Pro 上文本权重仅占用约 191MB 运行内存。

嵌入模型的作用是把内容转成向量,支撑相似度计算、检索与聚类。过去文本、图像通常各用各的模型,EmbeddingGemma 2 试图打通这种割裂。由于嵌入在端侧生成,开发者能降低流水线时延,并在完全离线的状态下完成跨模态搜索,适合本地代码库索引、语义代码检索以及编程智能体的检索增强生成。这类端侧嵌入模型也让数据不必离开设备,对隐私敏感场景更具吸引力。

上一代 EmbeddingGemma 去年发布后下载量已超过 2000 万次,被用于端侧搜索工具和隐私优先的 RAG 流程。当前多家公司都在推出轻量、可商用的开放权重模型,竞争焦点正从"越大越好"的云端生成模型,转向能跑在手机和 App 里、成本低廉的检索与理解底座。
读者评论 (1)
想参与讨论?请 登录 后发表评论。
端侧多模态嵌入终于来了,隐私党狂喜