网易首页 > 网易号 > 正文 申请入驻

掩码生成到「再掩码」训练:RemeDi让扩散语言模型学会纠正与反思

0
分享至

近期,扩散语言模型备受瞩目,提供了一种不同于自回归模型的文本生成解决方案。为使模型能够在生成过程中持续修正与优化中间结果,西湖大学 MAPLE 实验室齐国君教授团队成功训练了具有「再掩码」能力的扩散语言模型(Remasking-enabledDiffusion Language Model,RemeDi9B)。在扩散去噪的多步过程中,通过进行再掩码 SFT 和 RL 训练,为每个 token 输出一个去掩码置信度,RemeDi 能够从序列中已经生成的内容中识别无法确定的位置进行再掩码(remask),从而修正错误内容并提升文本质量,在各方面都超越了现有的扩散语言模型。该模型还具有可变长生成(variable-length generation)能力,打破了现有中大规模扩散语言模型仅支持定长生成的限制,提高了模式能力的灵活性。

  • 论文地址:https://arxiv.org/abs/2509.23653
  • 代码与模型地址:https://github.com/maple-research-lab/RemeDi

背景

扩散语言模型已成为自回归语言模型的有力替代方案。这一类方法首先定义了一个将文本逐步破坏为噪声的前向过程,然后让模型学习从噪声中恢复出干净文本的逆向过程。在这一类方法中,当前最主流的是基于掩码的扩散语言模型。该方案要求模型在训练中学习恢复被掩码的 token,而已经被恢复的 token 则在之后的生成步骤中保持不变,直到生成结束。这其中蕴含了一则假设:每一步中预测的 token 都必然是正确的,无需修正,直接可以当作最后的生成内容。这一假设显然过于理想 —— 生成过程中,模型不可避免地会产生预测错误,而我们应当赋予模型通过自我反思发现并修正这些错误的能力。

为解决这一问题,提出一种面向扩散语言模型的自我反思式生成范式 —— 再掩码(remask),并基于这一范式训练了具有「再掩码」能力的扩散语言模型 RemeDi。如图所示,RemeDi 具备发现错误 token,并通过再掩码将其修正的能力:模型首先生成了 “left”,但随后在生成完整句子的语义表示时,发现 “left for the pies” 这一表述与实际含义不符,因此,将 “left” 一词再掩码,修改为更合适的 “used”。可以看出,通过再掩码,模型能利用在后续步骤中生成的上下文信息,识别较早步骤中存在的错误,将其改正,并基于更丰富的上下文信息进行更精确的预测。

用置信度识别「再掩码」目标

为了让 RemeDi 能够通过再掩码修改已经生成的文本内容,一个核心的挑战是让模型能够找到需要修改的 token,执行再掩码操作。为此,我们对网络结构进行了修改,让其在预测序列中每个 token 输出分布的同时,能够为每个 token 额外预测一个置信度分数。整个模型采用了一种双流协同的模型结构:

此外,在语言生成任务中,许多场景下的输出并非固定长度。如果模型只能在固定长度下生成,将导致资源浪费或生成结果被压缩、截断。因此,使扩散语言模型具备灵活的不定长生成能力(variable-length generation)是必要的。在 RemeDi 中,我们采用分块自回归生成的方法实现这一点:模型每次会通过一个完整的反向扩散过程生成一段长为 L=32 的序列。完成后,如果该序列中没有生成结束符,则将已生成的这一段序列拼接在上下文中,继续往后生成下一段长为 L=32 的序列,如此重复直到生成结束符为止。与自回归模型类似,我们采用分块因果注意力掩码机制,确保在生成时,每个 token 能看到自己所在的 block 内的其他 token,和之前已生成 block 内的 token,而无法看到未来将要生成的 block。

在实验中,我们基于 LLaDA 的权重继续训练,将其改造成一个具有不定长生成能力的分块扩散模型。上面表 4 中的 baseline 模型即展示了不定长生成模型在经过再掩码训练前的性能。

两阶段训练,赋予「再掩码」能力

1.Remask SFT(监督微调阶段)

传统的掩码扩散语言模型通常通过在输入序列上随机掩码进行有监督微调(SFT)。与之不同的是,RemeDi 在反向扩散过程中还需要能够找到潜在的不正确 token 并再掩码。我们在 SFT 过程中将这类不正确 token 视为除掩码 token 之后的第二类噪声。因此,在 SFT 阶段,我们不仅要训练模型从掩码 token 恢复原文本的能力,同时也需要训练识别那些需要再掩码的不正确 token。

由于在反向扩散过程中,噪声水平(定义为 mask token 的数量)应当单调递减。由于在 SFT 设计中,长度为 L 的输入序列中,所有不正确 token 都必须被重新掩码,因此需要满足以下不等式约束:

以确保输出中掩码位置的数量单调减少。若该不等式不成立,则在下一步重新掩码所有不正确 token 会增加总的掩码数量,从而违反扩散过程中掩码比例应逐步减少的基本原则。

整个再掩码微调算法流程如下图:

2.Remask RL(强化学习阶段)

在完成 Remask SFT 训练后,我们进一步通过基于结果的强化学习对模型进行微调。根据实验室先前的研究,反向扩散过程中的每一步中间结果都可以视为大模型的一个「思考」步骤,而基于结果的强化学习可以优化整个生成轨迹,提升模型生成正确最终答案的概率。这种面向扩散语言模型的大模型推理范式称为扩散式「发散思维链」,在机器之心的往期报道中已有详细阐述。(与Gemini Diffusion共振!首个扩散式「发散思维链」来了)

实验结果

在同规模与相近计算预算下,RemeDi 在数学推理、代码生成与通用问答三类任务上均取得稳定提升。其中,仅采用 Remask SFT 带来显著增益;在此基础上加入 Remask RL,多数基准再获得进一步提升。

我们在不同类型的任务上对再掩码次数进行了统计,可以看出:对输出约束更强的任务(如代码生成)会更频繁触发再掩码。

而具体的生成示例也表明,通过再掩码机制,RemeDi 可以实现纠错、插入、删除等多种文本修改手段。

总结

这篇文章介绍了由西湖大学 MAPLE 实验室推出的,具有再掩码反思机制的扩散语言模型,RemeDi。基于额外的置信度预测,RemeDi 能够识别生成过程中的错误,并通过「再掩码」机制重新预测,从而做到生成过程中的自我反思与优化。针对「再掩码」机制设计的有监督训练与强化学习算法确保了这一机制的有效性。实验结果表明 RemeDi 在数学推理、代码生成、通用知识问答等多个任务上都取得了超越其他扩散语言模型的性能。这些结果说明「再掩码」能有效提升扩散语言模型的文本生成质量,值得进一步探讨。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
佩奇26+5李月汝4+6 飞翼主场力克水星

佩奇26+5李月汝4+6 飞翼主场力克水星

北青网-北京青年报
2026-09-20 19:27:17
俗话说“女人开两门,人财都难存”,身为女子,这两扇门开不得

俗话说“女人开两门,人财都难存”,身为女子,这两扇门开不得

古怪奇谈录
2025-11-10 16:48:54
研究发现:经常晚上刷牙的人,患高血压、脑梗风险比其他人低?

研究发现:经常晚上刷牙的人,患高血压、脑梗风险比其他人低?

叙说医疗健康
2026-08-12 09:00:22
熊磊发文悼念公公:泪洒直播间,恳请大家嘴下留德,公公才是受害者

熊磊发文悼念公公:泪洒直播间,恳请大家嘴下留德,公公才是受害者

江山挥笔
2026-09-19 17:39:00
安徽一对新人因名叫“尔康”和“紫薇”意外走红,有人质疑真实性,新娘:我们就叫这个名字,与丈夫确实是因名字结缘,亲友也感慨缘分奇妙

安徽一对新人因名叫“尔康”和“紫薇”意外走红,有人质疑真实性,新娘:我们就叫这个名字,与丈夫确实是因名字结缘,亲友也感慨缘分奇妙

扬子晚报
2026-09-20 15:12:26
A股:中央七部门联合重磅发布!请做好准备,下周盯紧三关键信号

A股:中央七部门联合重磅发布!请做好准备,下周盯紧三关键信号

虎哥闲聊
2026-09-05 10:00:51
硫磺熏笋事态失控!监管局确认,毒素超标百倍,货品销往全国各地

硫磺熏笋事态失控!监管局确认,毒素超标百倍,货品销往全国各地

笑饮孤鸿非
2026-09-19 20:16:27
大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

乒乓助手
2026-08-21 00:37:44
没忍住,把17 ProMac折价换了18proMax,用了一天,手先扛不住了

没忍住,把17 ProMac折价换了18proMax,用了一天,手先扛不住了

时尚的弄潮
2026-09-20 04:47:46
乒乓亚运会:世界冠军1-11惨败,国乒女团3-1逆转,孙颖莎打疯了

乒乓亚运会:世界冠军1-11惨败,国乒女团3-1逆转,孙颖莎打疯了

帛河体育
2026-09-20 17:52:04
亚运会|王子菲气步枪虽刷记录,憾得第五

亚运会|王子菲气步枪虽刷记录,憾得第五

北青网-北京青年报
2026-09-20 14:39:03
西贝要倒闭了,员工、上下游、食客为炮轰埋单?

西贝要倒闭了,员工、上下游、食客为炮轰埋单?

野马财经
2026-09-20 10:17:05
全网都骂周涛董卿不悼念敬一丹?葬礼现3个细节,打脸所有指责

全网都骂周涛董卿不悼念敬一丹?葬礼现3个细节,打脸所有指责

乡野小珥
2026-09-20 04:21:53
中国游客被带进VIP房:门上电子锁,一单狂砸上亿越南盾

中国游客被带进VIP房:门上电子锁,一单狂砸上亿越南盾

越南语学习平台
2026-09-18 18:20:48
四川彭州山区蛇患严重、致人死亡?警方回应

四川彭州山区蛇患严重、致人死亡?警方回应

新浪财经
2026-09-20 15:10:18
卢伟冰谈小米18 Pro系列定价:是会涨 但相信大家会觉得合理

卢伟冰谈小米18 Pro系列定价:是会涨 但相信大家会觉得合理

快科技
2026-09-20 19:11:04
西贝真的没救了,贾老板向自己砍下了最后一刀

西贝真的没救了,贾老板向自己砍下了最后一刀

云中有一鹤
2026-09-20 20:02:52
施一公动真格!西湖大学教师必须全职在岗,校外兼职一律禁止,学校的科研评价机制值得其他学校学习!

施一公动真格!西湖大学教师必须全职在岗,校外兼职一律禁止,学校的科研评价机制值得其他学校学习!

凯旋学长
2026-09-20 15:22:04
难受了?欧盟低估了中国。9月17日,据英国金融时报消息,欧盟已经正式宣布要求中国自愿限制混合动力车的出口

难受了?欧盟低估了中国。9月17日,据英国金融时报消息,欧盟已经正式宣布要求中国自愿限制混合动力车的出口

扶苏聊历史
2026-09-18 17:09:53
一年三款车,想想就怕。

一年三款车,想想就怕。

深读时刻
2026-09-19 05:14:10
2026-09-20 21:07:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14034文章数 142735关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

微博大V"理记"称西贝已起诉罗永浩:就要开庭了

头条要闻

微博大V"理记"称西贝已起诉罗永浩:就要开庭了

体育要闻

游泳2小时6金!亚运金牌榜:中国11金领跑

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

民企土地 被政府"无偿收储"后转手卖7亿

汽车要闻

FREELANDER神行者8开启交付 首批新车正式交付用户

态度原创

艺术
家居
教育
公开课
军事航空

艺术要闻

米芾写出 800 年来最美行书!字字精彩绝伦,外行看了都说美!

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

让更多的学生能够走上台来被看见,让更多的孩子在鼓励中成为他们想要的那个样子

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗称已向美政府传达7项谈判条件

无障碍浏览 进入关怀版