Google开源DiffusionGemma:生成提速4倍,质量仍落后Gemma 4

Google开源DiffusionGemma:生成提速4倍,质量仍落后Gemma 4

N
News Editor 01
2026-07-23 11:30:15
Google DeepMind发布开源模型DiffusionGemma,官方称其在RTX 5090和H100上生成速度约为同尺寸自回归Gemma模型的4倍,但公开基准成绩全面低于标准Gemma 4。
GoogleDiffusionGemmaGemma 4开源模型AI

Google DeepMind推出了Gemma 4开源家族的新成员DiffusionGemma。按官方测试,这一模型在Nvidia RTX 5090上每秒约可生成700个 token,在单张Nvidia H100上可超过每秒1,000个 token,速度约为同尺寸自回归Gemma模型的4倍。不过,Google���时披露,DiffusionGemma在已公布的公开基准测试中,成绩均低于标准Gemma 4。

用扩散方式生成文本,而不是逐个产出 token

主流语言模型通常采用自回归方式生成文本,也就是从左到右、一次确定一个 token。DiffusionGemma走的是另一条路线:先在整块输出区域填入占位 token,再通过多轮“去噪”同时更新所有位置,直到整段内容收敛成最终结果。这个逻辑更接近Stable Diffusion生成图像,而不是GPT类模型的顺序生成。

Google表示,这种结构在本地硬件上具备可量化的速度优势,模型也以Apache 2.0协议开源,开发者和研究人员可以直接使用、微调和研究。

26B参数的MoE设计,推理时仅激活3.8B

DiffusionGemma采用混合专家(MoE)架构。模型总参数量为260亿,但单次推理实际启用的参数只有38亿。这意味着它虽然整体规模不小,运行时的计算路径却更轻,量化后可放入高端显卡的18GB VRAM中执行。

它的并行能力也是速度提升的重要来源。标准自回归模型必须等前一个 token 生成后,后一个 token 才能继续计算;DiffusionGemma则会在多轮去噪中同步修正整段内容,单次最多可并行处理256个 token。这种机制适合依赖复杂相互关系的任务。Google举例提到数独,原因很直接:某一格是否正确,往往依赖其他尚未确定的位置,而扩散式生成允许模型反复修正整个答案。

速度优势来自硬件利用率变化

Google给出的解释是,自回归模型的推理更受内存带宽限制,因为每生成一个 token都要重复读取模型权重;扩散模型则更偏向算力密集型,一次处理大批 token,平均到每个 token上的内存读取次数更少。瓶颈变了。

这会直接影响GPU利用率。现代GPU的算力通常比内存带宽更充裕,自回归生成容易让计算单元等待数据;扩散式生成把任务摊到大规模并行计算里,更容易把硬件资源压满。按Google官方测试,RTX 5090上的速度约为每秒700个 token,H100则超过每秒1,000个 token。文章同时提醒,这些数据均来自官方测试,并非第三方独立验证,不同任务和生成长度下,实际表现可能会有差异。

公开基准成绩全面落后,速度换来的是质量下滑

这款模型的取舍也很明确。Google披露,在所有已公布的公开基准测试中,DiffusionGemma的得分都低于标准Gemma 4。也就是说,速度提升并非没有代价,生成质量出现了系统性下滑。

从适用场景看,如果任务更看重吞吐量、边缘设备本地推理,或对延迟很敏感,DiffusionGemma的设计有现实价值。Google提到的适用方向还包括行内编辑、分子序列生成和数学绘图。若任务更依赖答案质量,标准Gemma 4仍是更稳妥的选择。对本地AI社区来说,这个开源模型提供了一个可直接实验的样本:在有限硬件下,速度和质量究竟该怎么取舍。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。