网易首页 > 网易号 > 正文 申请入驻

速度提升,能力却暴跌?扩散模型做智能体的残酷真相

0
分享至



基于自回归语言模型的智能体已在许多场景中展现出完成复杂任务的能力,但高昂的推理成本和低下的执行效率问题仍然是制约智能体工作流(Agentic Workflow)发展的关键瓶颈。

与传统的自回归式语言模型不同,扩散语言模型(Diffusion-Based Language Models)采用并行解码机制,显著提升了生成速度,似乎为突破这一瓶颈带来了全新的可能性。

现有的关于 Llada、Dream 等扩散语言模型的研究中,这类模型在大幅度提高生成效率的同时,在 MMLU、GSM8K 等基准任务上保持了与自回归语言模型相当的通用能力。然而其在智能体任务上的表现尚缺乏系统性的评估。

基于这一问题,近期南洋理工大学的陶大程教授团队联合东南大学、阿里巴巴等发布了一份综合评测报告,通过对 2 个自回归语言模型和 4 个扩散语言模型在具身智能体(Embodied Agent)和工具调用智能体(Tool-Calling Agent)上的一系列实验,揭示了一个反直觉的发现:扩散语言模型在智能体能力方面存在系统性缺陷,显著落后于同规模的自回归模型!

这项工作揭示了一个深刻的教训(Bitter Lesson):尽管扩散语言模型实现了高效的并行推理,但也显著削弱了其因果推理和反思能力,难以可靠地执行具身智能体的长链推理任务;同时,并行解码机制使得输出具有更高的不确定性,这对于精确性要求极高的工具调用任务造成了重大挑战。



  • 论文标题:The Bitter Lesson of Diffusion Language Models for Agentic Workflows: AComprehensive Reality Check
  • 论文地址:
  • https://arxiv.org/pdf/2601.12979
  • 项目地址:
  • https://coldmist-lu.github.io/DiffuAgent/
  • 代码地址:
  • https://github.com/Coldmist-Lu/DiffuAgent/



一、为何失败?扩散模型

难以完成智能体任务的三大原因



  • 具身智能任务:因果推理能力不足,陷入重复循环

研究基于 AgentBoard 中的三个典型具身智能任务(AlfWorld、ScienceWorld 和 BabyAI)测试了模型的长链规划推理能力。结果显示,扩散语言模型的成功率(Success Rate)和平均任务进度(Progress Rate)均显著低于自回归模型,在部分任务甚至无法产生任何正确样例。

深入分析发现,扩散模型难以进行因果性的推理和实时反思,频繁陷入重复性操作循环(retry loop,见下图 a),而自回归语言模型则极少出现此类问题。

  • 工具调用任务:格式输出混乱,多轮调用几乎失效

研究采用伯克利函数调用基准(BFCL v3)进行评估,发现扩散语言模型在单轮与多轮工具调用场景中均落后于自回归模型。尤其在具有挑战性的多轮任务中,扩散模型几乎无法成功完成一次完整调用工作流。

进一步分析表明,扩散语言模型更容易产生格式不规范、语义模糊的调用输出(见下图 b),在要求严格的结构化输出场景下表现尤为突出。

  • 效率与能力的权衡:并行解码的隐性代价

尽管扩散语言模型以高吞吐量为卖点,但研究发现,更高的生成效率并不等同于更强的智能体能力(如下图 c)。相反,并行解码机制会削弱扩散语言模型的因果推理能力,并降低其在精确格式化输出方面的表现。



二、还有救吗?多智能体

评估框架 DiffuAgent 探寻真实潜力



由于扩散语言模型直接执行智能体工作流时会产生大量的失败案例,这对深入分析其能力带来了困难。为了探明扩散语言模型作为智能体的真实潜力,研究团队提出了一个多智能体评测框架 DiffuAgent,将复杂的智能体任务按能力维度拆解为多个模块,在智能体执行每个步骤的前后进行针对性评测:

  • 具身智能任务的模块化评估包括:用于定期储存智能体的运行轨迹、提供历史信息的记忆模块;以及用于检测模型是否能主动识别当前轨迹中的问题,并及时终止无效尝试的自验证模块。

  • 工具调用任务的模块化评估包括:在产生调用指令前,预先筛选出合适的工具候选的工具选择模块;以及对不规范的 JSON 格式进行自动纠正的格式修正模块。

三、能做什么?扩散模型

在各智能体模块中的能力边界

为深入分析扩散语言模型在智能体工作流中的具体表现,研究采用多智能体架构设计:以自回归语言模型作为主控模块,将扩散语言模型分别应用于不同的辅助模块,从而评估其对智能体整体性能的影响。

记忆模块:表现相当甚至更优



当扩散语言模型作为记忆模块时,其对智能体准确性的影响与自回归模型相当,使用 Llada、Dream 等模型时甚至效果优于自回归模型。

自验证模块:终止决策更加稳健



实验发现,自回归模型作为自验证模块时容易过早终止任务,即在智能体还未完成充分探索时就提前终止;而扩散模型在此场景下的终止判断更加可靠稳定。

工具调用模块:选择能力强,格式修正能力弱



在工具调用任务上,扩散语言模型能有效地完成工具选择;但由于其并行生成机制带来的模糊性,在需要精确格式的工具编辑任务上表现欠佳。

核心发现:并行解码机制带来的权衡与局限

对扩散语言模型在各智能体模块的表现分析,进一步验证了前文揭示的系统性缺陷:并行生成模式虽然导致了因果推理能力的缺失和动态决策能力的不足,但其在推理要求低的文本总结(记忆模块)和状态识别提取(自验证模块)等静态任务上表现出色;虽然难以完成高精确性的格式化输出(格式修正模块),却能有效的进行信息提取(工具选择模块)。这揭示了扩散模型「能力不均衡」的特性:擅长静态处理,弱于动态推理。

四、未来方向:对于

扩散语言模型智能体研究的启示

基于上述系统性评估,本研究从训练、解码和评估三个维度为扩散语言模型的研究者提供以下建议:

  • 训练层面:应强化因果推理与解构化能力。在预训练和微调阶段引入具有强因果关系数据,如多步推理任务和轨迹,并大幅增加结构化内容的比重,如 JSON 代码、API 调用等,从源头提升模型对格式规范的理解,并建立对因果依赖关系的敏感性。

  • 解码层面:探索自适应的混合生成策略。模型应基于任务特性自适应地选择解码方式,对关键的推理步骤采用自回归解码确保因果连贯,而对于静态任务和需要全局视野的长文本生成,采用并行解码以提升效率;此外可在解码过程中引入格式约束和校正来弥补不确定性的短板。

  • 评估层面:建立面向智能体应用的基准体系。当前扩散模型的评估过度依赖 MMLU、GSM8K 等通用基准,这些基准无法反应智能体任务关于因果推理、多轮交互和工具调用等需求。研究者应报告模型在例如 DiffuAgent 智能体评估框架的结果,并建立覆盖真实应用场景的评估体系,避免「跑分高但不实用」的问题。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
航运史上荒诞一幕上演:亚洲要买沙特石油 得绕行非洲

航运史上荒诞一幕上演:亚洲要买沙特石油 得绕行非洲

财联社
2026-07-22 10:34:16
颠覆三观!冉莹颖黑料越扒越狠,比败家更可怕的是,枉为人母

颠覆三观!冉莹颖黑料越扒越狠,比败家更可怕的是,枉为人母

不似少年游
2026-07-21 19:25:55
花旗:AI最终可能在中国取代约7000万个工作岗位

花旗:AI最终可能在中国取代约7000万个工作岗位

风向观察
2026-07-22 09:41:20
日本菲律宾既然搞事,现在就受着吧!

日本菲律宾既然搞事,现在就受着吧!

新民周刊
2026-07-22 09:10:42
又一个泡沫破了!文旅,成了今年最难做的生意?

又一个泡沫破了!文旅,成了今年最难做的生意?

智谷趋势
2026-07-21 16:36:34
突发!东莞两家30多年港资工厂同时宣告停产,近300名职工面临失业,未提及经济补偿

突发!东莞两家30多年港资工厂同时宣告停产,近300名职工面临失业,未提及经济补偿

火山詩话
2026-07-22 06:38:03
金门之战为何受挫?表面缺船少舟,实则肖锋与韩先楚在打法上产生了难以调和的分歧

金门之战为何受挫?表面缺船少舟,实则肖锋与韩先楚在打法上产生了难以调和的分歧

磊子讲史
2026-07-20 11:32:09
午后突发大跳水!怎么回事?

午后突发大跳水!怎么回事?

格隆汇
2026-07-22 14:26:08
林丹一家4口住西班牙别墅,买了2辆豪车,比邹市明有钱生活安逸

林丹一家4口住西班牙别墅,买了2辆豪车,比邹市明有钱生活安逸

椰黄娱乐
2026-07-22 12:30:23
2026年上调退休人员养老金通知,正式下发了么?算清三笔民生账!

2026年上调退休人员养老金通知,正式下发了么?算清三笔民生账!

白昼说故事
2026-07-22 09:52:05
厨师离职,老板要求交出配方?步骤不写清,不结工资……法院判了

厨师离职,老板要求交出配方?步骤不写清,不结工资……法院判了

极目新闻
2026-07-21 17:46:40
谢贤去世前张柏芝火速安排大儿子提前返港陪伴爷爷,谢贤曾多次公开称赞张柏芝“把孩子教得很好”

谢贤去世前张柏芝火速安排大儿子提前返港陪伴爷爷,谢贤曾多次公开称赞张柏芝“把孩子教得很好”

扬子晚报
2026-07-21 18:01:02
谢贤遗嘱曝光,王菲被说输得不冤,是张柏芝三胎生父传闻真相大白

谢贤遗嘱曝光,王菲被说输得不冤,是张柏芝三胎生父传闻真相大白

凡知
2026-07-21 15:30:16
瘫痪4年的申军谊后半生才终于明白:有些债,一辈子都还不完

瘫痪4年的申军谊后半生才终于明白:有些债,一辈子都还不完

品茗赏娱
2026-07-22 10:10:18
维尼修斯世界杯后整容“换脸”被热议,26岁的他让球迷几乎认不出自己

维尼修斯世界杯后整容“换脸”被热议,26岁的他让球迷几乎认不出自己

体育硬核说
2026-07-22 00:41:55
血赚1400亿,总统说还想要,美国办世界杯为什么不亏钱?

血赚1400亿,总统说还想要,美国办世界杯为什么不亏钱?

木蹊说
2026-07-21 18:24:48
为了证明自己不是猴子,菲律宾网友把它升级成金刚!结果更尴尬了

为了证明自己不是猴子,菲律宾网友把它升级成金刚!结果更尴尬了

青青子衿
2026-07-22 03:39:10
上海40岁女子自曝丈夫和侄女保持关系2年,破坏18年婚姻

上海40岁女子自曝丈夫和侄女保持关系2年,破坏18年婚姻

九方鱼论
2026-07-22 06:39:14
400亿遗产深锁瑞士银行已整整18年,子女屡次想提取却始终分文未得,王永庆生前布下的这步棋,让所有人哑口无言

400亿遗产深锁瑞士银行已整整18年,子女屡次想提取却始终分文未得,王永庆生前布下的这步棋,让所有人哑口无言

人生录
2026-07-22 00:05:16
“牡丹花下死,做鬼也风流”!这一次,75岁的张纪中彻底成了笑话

“牡丹花下死,做鬼也风流”!这一次,75岁的张纪中彻底成了笑话

小鱼爱鱼乐
2026-07-15 12:14:00
2026-07-22 16:08:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13576文章数 142698关注度
往期回顾 全部

科技要闻

怕了?美财长扬言:严查中国AI

头条要闻

A股史上最大财务造假案判了 马兴田夫妇被判赔13.96亿

头条要闻

A股史上最大财务造假案判了 马兴田夫妇被判赔13.96亿

体育要闻

阿根廷的亚军:单核足球的极限?

娱乐要闻

谢贤离世风波再起!王菲探望细节曝光

财经要闻

美国想对中国AI动手?"大人,时代变了"

汽车要闻

上汽贾健旭谈汽车全球化:出海要合规 欧洲人只爱小车是误解

态度原创

游戏
手机
教育
艺术
家居

AI涩涩称霸《老滚5》模组社区!创作者叫苦不迭

手机要闻

华为首款10000mAh手机降临:麒麟8系坐镇 中端机续航怪兽

教育要闻

视频丨教育部:我国基础教育总体达到高收入国家平均水平

艺术要闻

冷军34年前画了幅面具,拍了172.5万

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版