谷歌开源 EmbeddingGemma 2 多模态嵌入模型,可在本地设备运行
谷歌于 10 月 6 日发布 EmbeddingGemma 2,参数规模 7.4 亿,采用 Apache 2.0 许可。该模型将文本、代码、图像、音频与视频映射到同一向量空间,并支持纯文本精简配置,可在本地设备上运行,便于把检索数据留在用户侧。
10 月 6 日,谷歌发布多模态嵌入模型 EmbeddingGemma 2,参数规模为 7.4 亿,采用 Apache 2.0 开源许可。与去年仅支持文本的上一代不同,新模型把文本、代码、图像、音频与视频统一映射进同一个共享向量空间,让跨模态的语义检索成为可能。

在架构上,EmbeddingGemma 2 基于 Gemma 4 构建,默认输出 768 维向量;通过可选的编码器配置,可切换为更小的纯文本版本,在资源受限的设备上运行。谷歌特别强调了“本地化”取向——开发者可以把检索数据保留在用户自己的设备里,而不必上传到云端,这在隐私合规日益严格的背景下颇具吸引力。

从能力看,新模型在文本、图像与音频的嵌入基准上均有对应表现,覆盖了常见的检索与聚类任务。对应用开发者而言,它适合做本地知识库、相册与媒体库的语义搜索,以及端侧智能体的记忆与召回。相比必须调用大模型的生成式方案,轻量嵌入模型在延迟与成本上优势明显。
谷歌把 EmbeddingGemma 2 定位为端侧 AI 检索的基础设施之一,与其 Gemini 系列形成互补:前者负责“理解并组织数据”,后者负责“生成与推理”。在开源与本地部署成为行业共识的当下,这类兼顾许可友好与设备端运行的嵌入模型,正成为构建私有化智能应用的常见起点。
读者评论 (0)
想参与讨论?请 登录 后发表评论。
还没有评论,欢迎抢沙发!