谷歌发布 EmbeddingGemma 2 开源模型,把多模态向量检索搬上手机
谷歌 DeepMind 于 10 月 6 日正式发布 EmbeddingGemma 2,这是一款面向端侧设备的开源多模态嵌入模型。所谓“嵌入”,是把文本、图片、音频等内容转换成一串可用于比较相似度的数字;EmbeddingGemma 2 的特别之处在于,它能把文本、代码、图像、音频和视频统一映射进同一个向量空间。

模型总参数量为 7.4 亿,采用模块化设计:纯文本仅需约 2.7 亿参数,视觉与音频编码器可按需加载。它基于 Gemma 4 架构,以 Apache 2.0 协议开源,权重已在 Hugging Face 与 Kaggle 上线,开发者可在 Ollama、llama.cpp、sentence-transformers 等工具中调用。
EmbeddingGemma 2 主打“在设备本地运行”。谷歌称,借助量化,在 Pixel 手机上纯文本权重仅需约 191MB 内存,完整多模态模型约 567MB。这意味着语义搜索、以图搜视频、零样本意图识别等能力,不必把数据上传到云端即可完成,对医疗、法务等重视隐私的场景尤为友好。

为节省向量库的存储空间,模型支持“套娃式”表征学习(Matryoshka Representation Learning),可将 768 维的向量截断到 512、256 或 128 维,谷歌称最多可节省约六倍存储。上下文窗口为 8000 token,相比上一代扩大四倍,可容纳约 5.5 分钟音频或 58 帧视频。
这类开源模型的普及,正在降低本地检索与检索增强生成(RAG)的门槛。过去,高质量嵌入模型多依赖云端服务,数据与请求都要经过厂商服务器;而端侧开源方案让开发者在保护隐私的同时,也能离线构建自己的搜索引擎与智能助手。对边缘 AI 生态而言,这是把能力从云端下沉到设备的关键一步。
读者评论 (0)
想参与讨论?请 登录 后发表评论。
还没有评论,欢迎抢沙发!