谷歌发布 Gemma 4 12B 开源多模态模型,16GB 显存即可本地运行
谷歌 DeepMind 推出 Gemma 4 12B,一款 119.5 亿参数的开源多模态模型,无需独立编码器即可处理文本、图像与音频,在消费级笔记本 16GB 显存下本地运行,并采用 Apache 2.0 许可。
谷歌 DeepMind 于近日发布 Gemma 4 12B,这是 Gemma 开放模型家族中首个中等规模的“统一架构”多模态模型。它把文本、图像与音频的处理直接融入单一 Transformer,不再依赖独立的多模态编码器,并以 Apache 2.0 许可向开发者开放权重。

该模型参数量为 119.5 亿,采用无编码器设计——视觉与音频信号通过轻量线性层直接投影进语言模型主干,显著降低延迟与内存占用。官方称其上下文窗口最长可达 25.6 万个 token,支持 140 多种语言,并在 MMLU Pro、AIME 2026、LiveCodeBench 等基准上接近更大的 26B MoE 模型。
最关键的卖点是“笔记本可跑”。Gemma 4 12B 仅需 16GB 显存或统一内存即可在消费级设备上本地推理,使多模态智能体摆脱对云端的依赖。配合 Google AI Edge Gallery、Ollama、llama.cpp、MLX 等生态工具的“首发日”支持,开发者可在离线环境构建处理敏感数据的代理工作流,推理成本趋近于零。
在谷歌的产品版图中,Gemma 作为开源模型与闭源的 Gemini 形成互补:前者面向端侧与开源社区,后者服务云端 API。随着模型下载量突破 1.5 亿次,谷歌正通过开放权重与本地化部署,争夺边缘 AI 与开发者生态的话语权。
读者评论 (1)
想参与讨论?请 登录 后发表评论。
16G显存跑多模态确实香,感觉端侧智能体终于能落地了