Google 于 6 月 3 日发布 Gemma 4 12B,把 Gemma 4 系列里长期缺失的一档补上。按官方说法,这款模型不需要高价 AI 加速器,设备只要具备 16GB 系统内存或显存,就可以在消费级笔记本上本地运行。
填上 Gemma 4 产品线中间一档
Google 在今年 4 月首次推出 Gemma 4 家族时,共有 4 款模型:面向移动设备优化的 E2B、E4B,以及偏服务器场景的 26B MoE 和 31B Dense。产品线从轻量边缘到高规格云端都有覆盖,但本地笔记本场景一直缺少合适选项。12B 的推出,正好落在这个空档。
从架构看,26B MoE 属于混合专家模型,推理时不会动用全部参数,每个 token 实际大约只使用 4B 参数。但整套 260 亿参数仍要预先载入内存,才能维持路由和推理速度,所以内存占用依旧接近同体量稠密模型。31B Dense 则是传统稠密架构,每次推理都调用全部参数。相比之下,Gemma 4 12B 的实际内存占用约为 8.1GB,大致只有 26B MoE 的一半。
官方跑分接近 26B MoE
Google 在公告中称,Gemma 4 12B 在多项基准测试上的表现“几乎一样强”,可与体量约为其两倍的 26B MoE 接近。官方列出的测试包括 GPQA Diamond、MMLU Pro 和 DocVQA,分数确实靠近 26B 版本。
不过,这些成绩目前主要来自 Google 官方自测,还没有看到独立第三方的完整复现。基准测试只能反映起点,放到真实任务里,差距可能扩大,也可能缩小。另一个现实问题是,“16GB 可跑”在技术上成立,但如果设备同时开启浏览器和办公软件,留给模型的空间并不宽裕,日常使用能否顺畅仍取决于具体环境。
沿用 Apache 2.0 许可并支持多模态输入
授权层面,Gemma 4 家族继续采用 Apache 2.0 开放许可,允许商业使用、修改和再分发,开发者可以直接集成到产品中,无需逐案申请授权。
Gemma 4 12B 还是一款多模态模型,采用无编码器的统一架构,可直接处理文字、图片、音频和视频输入,不需要额外挂载不同编码组件。对希望在本地设备部署模型的开发者来说,这一版本把硬件门槛压到了更常见的消费级区间。

