DiffusionGemma 是由谷歌(Gemma团队)发布的一项基于离散扩散技术的实验性开源语言模型。该模型旨在解决传统自回归(AR)大语言模型在生成文本时必须逐个解码的串行瓶颈。DiffusionGemma 基于 Gemma 4 混合专家模型(3.8B 激活参数,25.2B 总参数)进行微调,通过迭代并行细化 256 个 token 的块来生成文本。其计算高效的两阶段训练流程仅使用了不到原模型 10% 的训练预算。在性能表现上,DiffusionGemma 在单张 NVIDIA H100 GPU 上实现了约 1500 tokens/秒的生成速度,远超采用推测解码技术的传统自回归模型。此外,该模型保留了原始 Gemma 4 的“思考模式”、多模态输入和长上下文支持,并仍能进行自回归生成,为未来混合扩散-AR解码的发展提供了路径。
事件分析
核心观点:DiffusionGemma证明了并行解码是打破大模型推理速度瓶颈的关键,混合架构或将重塑下一代AI生成范式。
原文链接:Hacker News

评论前必须登录!
立即登录 注册