网易首页 > 网易号 > 正文 申请入驻

ACL 2026|块越大,推理越差?扩散语言模型的新难题被T*破解了

0
分享至




本文第一作者夏翰宸为上海科学智能研究院研究员,主要研究方向有Agentic RL和多模态扩散语言模型。共同一作是上海科学智能研究院主任研究员陈保友,通讯作者是复旦大学教授、上海科学智能研究院AI科学家、上海创智学院全时导师朱思语。

扩散语言模型想用更大的生成块换取更高并行度,却常常先丢掉数学推理,直接在大块模型上做强化训练甚至会出现训练崩塌。

本文中,来自上海科学智能研究院等机构的研究者提出T*,给出一套「先小后大」的课程:先在小块上学稳去噪轨迹,再逐级扩展到 B=8、16、32。4B 模型在 B=8 的 MATH500 设置下,相较原始 SDAR checkpoint 从 60.73 提升到 76.00。



  • 论文标题:T*: Progressive Block Scaling for Masked Diffusion Language Models Through Trajectory Aware Reinforcement Learning
  • 论文链接:https://arxiv.org/pdf/2602.09375

扩散语言模型的两难:块越大,并行潜力越高,推理也越脆弱

今天的大语言模型大多采用自回归生成:每次前向计算确定一个新 token,再继续生成下一个。它的因果顺序清晰,但天然带有串行瓶颈。

掩码扩散语言模型走的是另一条路线。模型先面对一段仍包含多个掩码位置的序列,再通过多轮去噪逐步确定答案。采用分块扩散时,块大小 B 决定了每一块中有多少 token 可以共同更新。块越大,模型在一次前向中同时定稿多个 token 的空间越大;但模型同时面对的未决位置也更多,条件信息更弱,去噪决策更难。

这一矛盾在强化学习阶段被进一步放大。论文分析认为,大块设置会带来置信度更低、噪声更大的 rollout;当同一个优势信号被分配给更多 token 时,策略更新更容易发生概率漂移,最终出现训练崩塌。

论文的 1.7B 实验给出了一个直观例子:直接应用 TraceRL 时,MATH500 准确率在 B=8 阶段由约 56% 快速跌入 40% 出头,在 B=16 阶段末又跌至约 30%;T* 的曲线则在连续扩块过程中保持相对稳定。



图 1|扩块训练过程中的 MATH500 验证准确率。蓝线为 T*,绿色虚线为直接 TraceRL;纵向虚线对应 B=4→8→16 的阶段切换。

核心方法:T * 先把「小步」走稳,再逐级放大生成块

T* 的核心并不是增加一个更复杂的模型模块,而是重新安排强化学习的难度顺序。

它从一个由自回归模型初始化、已经具备推理能力的小块扩散模型出发。在固定块大小 B 的每个阶段,模型先用 TraceRL 重新适配当前的去噪轨迹;完成规定的更新步数后,再把块大小扩大为原来的两倍。

实验中的典型路径是:B=4 → B=8 → B=16 → B=32。

实验结果:T * 在大块设置更稳定

论文在 SDAR-1.7B-Chat 和 SDAR-4B-Chat 上进行实验,评测覆盖 MATH500、GSM8K 和 AIME24,统一报告 Pass@3。对照组包括原始 SDAR checkpoint,以及在同一目标块大小上直接应用 TraceRL 的模型。

经过 T* 训练,SDAR-4B-Chat, B=8 在 MATH500 上达到 76.00%,相比原始模型提升15.27%,相比直接 TraceRL 提升13.90%。在 GSM8K 和 AIME24 上,也取得了更高结果。

在更大的 B=32 设置下,1.7B 模型仍能看到一致趋势:T* 的 MATH500 准确率为 59.00,超过原始模型的准确率 54.20 和 TraceRL 的 54.10;GSM8K 则由原始模型的 78.31 提升至82.00。



图 2|不同模型规模和块大小下的性能。黑色为原始模型,绿色为直接 TraceRL,蓝色为 T*。

推理能力提高后,并行性并没有被「换回」自回归

一个自然疑问是:T* 会不会只是让扩散模型重新退回逐 token、从左到右的生成方式,从而换回准确率?

论文使用TPF(tokens per forward)衡量每次模型前向平均能定稿多少个输出 token。自回归模型为 1.0;分块扩散模型可以在同一块内并行确定多个 token,因此 TPF 越高,说明块内并行性越强。

在 1.7B 模型上,T* 的 TPF 随块大小从 B=8 的2.95,提升到 B=16 的3.38,再到 B=32 的3.80。



表 1|去噪顺序、准确率与 TPF。LocalStrict 越接近 1.0,生成顺序越接近严格从左到右。

论文还报告,对于原始 SDAR-1.7B,从 B=8 扩到 B=16 和 B=32,TPF 分别提高约 16% 和 29%;在固定输出长度下,对应所需前向次数约减少 14% 和 22%。T* 和 TraceRL 并没有消除这一随块大小增加的并行性趋势。

论文进一步使用 LocalStrict 衡量去噪顺序与标准从左到右顺序的接近程度。严格自回归顺序的 LocalStrict 为 1;数值越低,表示模型保留了更多非单调的掩码更新。T* 在 B=8、16、32 下的 LocalStrict 分别为 0.854、0.804 和 0.730,并未回到 1。以 B=32 为例,T* 在 LocalStrict=0.730、TPF=3.80 的同时取得 59.0 的 MATH500 准确率。这说明准确率改善不能简单解释为 “模型重新变成自回归”,而是策略在目标块大小下形成了另一种 token 定稿顺序。



图 4|TraceRL 与 T* 的 token 首次解掩码步骤。颜色越深,代表该 token 越晚定稿;两种方法均保留非单调更新,但在目标块大小下学到的调度不同。

上图结果也提供了一个更具研究意味的观察:除在外部显式构造树搜索、图搜索等推理脚手架外,强化学习还可能直接重塑模型内部的 token 定稿顺序。论文将其视为一条互补方向,而不是对现有搜索式推理方法的替代。

【ICML 2026首尔 · 云帆AI Talent Meetup】最后报名中

7月9日晚,首尔ICML会场旁,上海人工智能实验室、上海科技大学、上海创智学院、阶跃星辰、Sharpa Robotics等20余家上海顶尖AI单位现场设展,开放100+岗位。专场招聘、学术分享、圆桌交流、自由Networking一站式搞定。

扫码即刻报名。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
亚运会重磅奖项奖金出炉,中国选手成热门人选,张展硕基本稳了

亚运会重磅奖项奖金出炉,中国选手成热门人选,张展硕基本稳了

南海浪花
2026-09-30 12:30:27
过分了!林诗栋金牌颁奖,现场球迷疯狂嘲讽,网友建议连夜去德国

过分了!林诗栋金牌颁奖,现场球迷疯狂嘲讽,网友建议连夜去德国

宗介说体育
2026-09-29 13:03:50
跨性别工程主管遭中国岳父母枪杀,他曾由女变男,这家人的纠纷很复杂

跨性别工程主管遭中国岳父母枪杀,他曾由女变男,这家人的纠纷很复杂

西楼知趣杂谈
2026-09-30 07:20:24
阿斯:恩德里克新赛季前8场仅出场4分钟,球员在冬窗可能离队

阿斯:恩德里克新赛季前8场仅出场4分钟,球员在冬窗可能离队

懂球帝
2026-09-30 22:58:11
世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

福建睿平
2026-08-28 07:25:16
挺着大肚也能飞!身高166体重170门将6次神扑 FIFA147非预赛逼平昔日冠军

挺着大肚也能飞!身高166体重170门将6次神扑 FIFA147非预赛逼平昔日冠军

狍子歪解体坛
2026-09-30 17:46:15
恭喜,全红婵正式上任,亮相新岗位,薪酬曝光,新造型惊艳

恭喜,全红婵正式上任,亮相新岗位,薪酬曝光,新造型惊艳

可读
2026-09-29 22:47:25
离婚9年,傅程鹏程愫高调认爱,给内娱上了一课,终是周励淇输了

离婚9年,傅程鹏程愫高调认爱,给内娱上了一课,终是周励淇输了

眼底星碎
2026-09-29 00:33:20
马斯克这一改口,为何让特朗普都会谢

马斯克这一改口,为何让特朗普都会谢

澎湃新闻
2026-09-30 12:22:23
奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

轻扬墨雨
2026-08-14 13:21:23
原来他是刘欢的亲家,重庆有头有脸的人物,经济实力雄厚还宠儿媳

原来他是刘欢的亲家,重庆有头有脸的人物,经济实力雄厚还宠儿媳

凡知
2026-09-27 12:23:36
2-0!巴萨飞翼2场2球,贝林厄姆遭遇神扑,英格兰知耻后勇

2-0!巴萨飞翼2场2球,贝林厄姆遭遇神扑,英格兰知耻后勇

我的护球最独特
2026-09-30 04:51:30
演员潘粤明画的一幅鬼画,网友:狗链子画的好!

演员潘粤明画的一幅鬼画,网友:狗链子画的好!

乡野小珥
2026-09-21 04:03:10
45岁母亲雾天开车买菜失踪,10年后女儿打车上班,发现是妈妈的爱车

45岁母亲雾天开车买菜失踪,10年后女儿打车上班,发现是妈妈的爱车

今天说故事
2025-07-02 17:31:55
骑行圈里的熟女穿搭,紧身骑行服巧妙勾勒丰腴曲线,氛围感拉满

骑行圈里的熟女穿搭,紧身骑行服巧妙勾勒丰腴曲线,氛围感拉满

只要高兴就好
2026-09-25 09:08:23
当你接触的男人越多,就会发现:那些情商极高,会哄你,情绪价值拉满的男人,爱最飘,钱最不舍得花,心也最容易变

当你接触的男人越多,就会发现:那些情商极高,会哄你,情绪价值拉满的男人,爱最飘,钱最不舍得花,心也最容易变

犀利强哥
2026-08-12 06:59:52
美股三大股指期货全线转跌

美股三大股指期货全线转跌

每日经济新闻
2026-09-30 19:08:05
李思自述:生父李连杰抛弃妈妈和我,如果可以的话我宁愿没这父亲

李思自述:生父李连杰抛弃妈妈和我,如果可以的话我宁愿没这父亲

瑾瑜聊情感
2025-10-10 13:12:06
浓眉:以我们的人员和天赋 我们应该成为联盟前十的防守球队

浓眉:以我们的人员和天赋 我们应该成为联盟前十的防守球队

北青网-北京青年报
2026-09-30 20:30:03
穆里尼奥气炸!皇马钉子户坑惨全队!拒走一人毁掉整个夏窗

穆里尼奥气炸!皇马钉子户坑惨全队!拒走一人毁掉整个夏窗

澜归序
2026-09-30 08:07:19
2026-10-01 00:52:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14113文章数 142740关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

美国著名演员史泰龙发声:我糟蹋了自己的身体

头条要闻

美国著名演员史泰龙发声:我糟蹋了自己的身体

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

“杭州六小龙”迎来价值重估

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

房产
本地
时尚
数码
公开课

房产要闻

利好频发!国庆置业窗口期,收好这份优惠攻略!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

从理性到反叛,看米兰时装周风格流转

数码要闻

阶跃终端STEPX Neo智能体手机已获工信部入网许可

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版