DiffusionGemma 是由谷歌(Gemma团队)发布的一项基于离散扩散技术的实验性开源语言模型。该模型旨在解决传统自回归(AR)大语言模型在生成文本时必须逐个解码的串行瓶颈。DiffusionGemma 基于 Gemma 4 混合专家模型(3.8B 激活参数,25.2B 总参数)进行微调,通过迭代并行细化 256 个 token 的块来生成文本。其计算高效的两阶段训练流程仅使用了不到原模型 10% 的训练预算。在性能表现上,DiffusionGemma 在单张 NVIDIA H100 GPU 上实现了约 1500 tokens/秒的生成速度,远超采用推测解码技术的传统自回归模型。此外,该模型保留了原始 Gemma 4 的“思考模式”、多模态输入和长上下文支持,并仍能进行自回归生成,为未来混合扩散-AR解码的发展提供了路径。
事件分析
该报告标志着扩散模型技术成功从图像生成领域迁移至文本生成领域,并在推理速度上实现了质的飞跃。传统自回归模型的“串行解码”特性限制了 GPU 的并行计算潜力,而 DiffusionGemma 的并行细化机制释放了硬件算力。这对产业界意味着,在实时对话、高吞吐量内容生成等对延迟敏感的场景中,非自回归架构将成为重要突破口。虽然目前仍处于实验阶段,但其仅用少量算力微调即获效的成果,可能会引发大模型架构从单纯的 Transformer 变体向扩散混合架构演进的新趋势。
核心观点:DiffusionGemma证明了并行解码是打破大模型推理速度瓶颈的关键,混合架构或将重塑下一代AI生成范式。
原文链接:Hacker News