Google DeepMind 近日发布了一款名为 DiffusionGemma 的实验性开源语言模型技术报告。这款模型的核心突破在于,它不再像传统大语言模型那样逐字生成文本,而是采用离散扩散技术,一次并行精修 256 个 token 的文本块,从而绕开了自回归模型固有的顺序解码瓶颈。
报告显示,在单张 NVIDIA H100 GPU 上,DiffusionGemma 平均每秒可生成约 1500 个输出 token,每次前向传播大约产出 20 个 token。这一速度显著超越了当前最先进的自回归模型——即便是采用了投机解码(speculative decoding)技术的方案,也难以企及这个水平。
不从头训练,微调 Gemma 4 而来
值得关注的是,DiffusionGemma 并非从零开始训练的模型。研究团队以混合专家架构的 Gemma 4 模型为基础进行微调,该模型激活参数为 38 亿,总参数达 252 亿。整个训练过程采用了两阶段的高效流水线,所消耗的训练 token 预算不到原始自回归模型的 10%。
具体而言,第一阶段使用监督微调来教会模型进行双向去噪;第二阶段则将强化学习与采样器蒸馏(sampler distillation)相结合,同步优化生成质量和推理效率。这种计算效率极高的训练方案,让 DiffusionGemma 在生成速度与模型能力之间建立了一条新的帕累托前沿(Pareto frontier)。
扩散微调后,自回归能力依然保留
除了速度优势,DiffusionGemma 还保留了基础模型的多种能力。报告指出,经过扩散微调后,模型依然支持思考模式、多模态输入和长上下文处理。更值得注意的是,尽管经过了扩散方向的微调,DiffusionGemma 仍然具备自回归生成能力,且性能仅有轻微下降。
这一特性为混合扩散-自回归解码方案提供了现实路径——未来模型可以根据任务需求,在极速扩散生成与精细自回归生成之间灵活切换,而不必在两者之间做非此即彼的选择。
速度与能力的权衡,有了新答案
长期以来,大语言模型的生成速度与模型能力之间存在此消彼长的关系。DiffusionGemma 的发布,为这一权衡提供了新的参考答案:通过扩散机制并行精修文本块,配合高效的训练策略,可以在不牺牲过多能力的前提下,将生成速度提升一个量级。
作为开源权重模型,DiffusionGemma 的技术细节已随报告公开,研究社区可以在此基础上复现、验证并进一步探索扩散模型在语言生成领域的潜力。对于依赖大规模文本生成的推理场景而言,这一方向的实际价值值得持续关注。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.