Google DeepMind在6月中旬发布了DiffusionGemma模型,近日又公开了配套技术报告。与普通语言模型逐token生成文本不同,DiffusionGemma一次并行精修256个token的文本块,类似图像AI从噪声中还原图片。在Nvidia H100加速器上,模型每秒可生成约1500个token。 最关键的是,构建这个扩散模型并不需要从零开始训练。团队基于已有的Gemma-4-26B-A4B,只用了不到原始训练token预算的10%,就把它改造成了扩散模型。 训练分两阶段,兼顾质量与速度。第一阶段,模型学习从示例数据中重建被噪声污染的文本块;第二阶段,Google将强化学习与采样器蒸馏合为单一流程,称为SD·RL。强化学习通常提升回答质量,采样器蒸馏则让模型用更少的计算步骤完成生成。报告称,合并训练后,DiffusionGemma在推理基准上的平均得分提高了10个百分点,每一步计算产出的token数接近原来的4倍。副作用是回答长度缩短约50%,速度因此进一步提升。 DiffusionGemma还具备双向推理能力,这让它能自我修正。普通语言模型必须先确定答案的第一个数字,再逐步推导;报告中的一道数学题里,Gemma 4先写下“-1”,推导到一半发现“-25”才对,只能事后追加更正。DiffusionGemma则并行推导答案和推理过程,因此可以在生成过程中及时发现并修正错误。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.