网易首页 > 网易号 > 正文 申请入驻

速度提升,能力却暴跌?扩散模型做智能体的残酷真相

0
分享至

基于自回归语言模型的智能体已在许多场景中展现出完成复杂任务的能力,但高昂的推理成本和低下的执行效率问题仍然是制约智能体工作流(Agentic Workflow)发展的关键瓶颈。

与传统的自回归式语言模型不同,扩散语言模型(Diffusion-Based Language Models)采用并行解码机制,显著提升了生成速度,似乎为突破这一瓶颈带来了全新的可能性。

现有的关于 Llada、Dream 等扩散语言模型的研究中,这类模型在大幅度提高生成效率的同时,在 MMLU、GSM8K 等基准任务上保持了与自回归语言模型相当的通用能力。然而其在智能体任务上的表现尚缺乏系统性的评估。

基于这一问题,近期南洋理工大学的陶大程教授团队联合东南大学、阿里巴巴等发布了一份综合评测报告,通过对 2 个自回归语言模型和 4 个扩散语言模型在具身智能体(Embodied Agent)和工具调用智能体(Tool-Calling Agent)上的一系列实验,揭示了一个反直觉的发现:扩散语言模型在智能体能力方面存在系统性缺陷,显著落后于同规模的自回归模型!

这项工作揭示了一个深刻的教训(Bitter Lesson):尽管扩散语言模型实现了高效的并行推理,但也显著削弱了其因果推理和反思能力,难以可靠地执行具身智能体的长链推理任务;同时,并行解码机制使得输出具有更高的不确定性,这对于精确性要求极高的工具调用任务造成了重大挑战。

  • 论文标题:The Bitter Lesson of Diffusion Language Models for Agentic Workflows: AComprehensive Reality Check
  • 论文地址:
  • https://arxiv.org/pdf/2601.12979
  • 项目地址:
  • https://coldmist-lu.github.io/DiffuAgent/
  • 代码地址:
  • https://github.com/Coldmist-Lu/DiffuAgent/

一、为何失败?扩散模型

难以完成智能体任务的三大原因

  • 具身智能任务:因果推理能力不足,陷入重复循环

研究基于 AgentBoard 中的三个典型具身智能任务(AlfWorld、ScienceWorld 和 BabyAI)测试了模型的长链规划推理能力。结果显示,扩散语言模型的成功率(Success Rate)和平均任务进度(Progress Rate)均显著低于自回归模型,在部分任务甚至无法产生任何正确样例。

深入分析发现,扩散模型难以进行因果性的推理和实时反思,频繁陷入重复性操作循环(retry loop,见下图 a),而自回归语言模型则极少出现此类问题。

  • 工具调用任务:格式输出混乱,多轮调用几乎失效

研究采用伯克利函数调用基准(BFCL v3)进行评估,发现扩散语言模型在单轮与多轮工具调用场景中均落后于自回归模型。尤其在具有挑战性的多轮任务中,扩散模型几乎无法成功完成一次完整调用工作流。

进一步分析表明,扩散语言模型更容易产生格式不规范、语义模糊的调用输出(见下图 b),在要求严格的结构化输出场景下表现尤为突出。

  • 效率与能力的权衡:并行解码的隐性代价

尽管扩散语言模型以高吞吐量为卖点,但研究发现,更高的生成效率并不等同于更强的智能体能力(如下图 c)。相反,并行解码机制会削弱扩散语言模型的因果推理能力,并降低其在精确格式化输出方面的表现。

二、还有救吗?多智能体

评估框架 DiffuAgent 探寻真实潜力

由于扩散语言模型直接执行智能体工作流时会产生大量的失败案例,这对深入分析其能力带来了困难。为了探明扩散语言模型作为智能体的真实潜力,研究团队提出了一个多智能体评测框架 DiffuAgent,将复杂的智能体任务按能力维度拆解为多个模块,在智能体执行每个步骤的前后进行针对性评测:

  • 具身智能任务的模块化评估包括:用于定期储存智能体的运行轨迹、提供历史信息的记忆模块;以及用于检测模型是否能主动识别当前轨迹中的问题,并及时终止无效尝试的自验证模块。

  • 工具调用任务的模块化评估包括:在产生调用指令前,预先筛选出合适的工具候选的工具选择模块;以及对不规范的 JSON 格式进行自动纠正的格式修正模块。

三、能做什么?扩散模型

在各智能体模块中的能力边界

为深入分析扩散语言模型在智能体工作流中的具体表现,研究采用多智能体架构设计:以自回归语言模型作为主控模块,将扩散语言模型分别应用于不同的辅助模块,从而评估其对智能体整体性能的影响。

记忆模块:表现相当甚至更优

当扩散语言模型作为记忆模块时,其对智能体准确性的影响与自回归模型相当,使用 Llada、Dream 等模型时甚至效果优于自回归模型。

自验证模块:终止决策更加稳健

实验发现,自回归模型作为自验证模块时容易过早终止任务,即在智能体还未完成充分探索时就提前终止;而扩散模型在此场景下的终止判断更加可靠稳定。

工具调用模块:选择能力强,格式修正能力弱

在工具调用任务上,扩散语言模型能有效地完成工具选择;但由于其并行生成机制带来的模糊性,在需要精确格式的工具编辑任务上表现欠佳。

核心发现:并行解码机制带来的权衡与局限

对扩散语言模型在各智能体模块的表现分析,进一步验证了前文揭示的系统性缺陷:并行生成模式虽然导致了因果推理能力的缺失和动态决策能力的不足,但其在推理要求低的文本总结(记忆模块)和状态识别提取(自验证模块)等静态任务上表现出色;虽然难以完成高精确性的格式化输出(格式修正模块),却能有效的进行信息提取(工具选择模块)。这揭示了扩散模型「能力不均衡」的特性:擅长静态处理,弱于动态推理。

四、未来方向:对于

扩散语言模型智能体研究的启示

基于上述系统性评估,本研究从训练、解码和评估三个维度为扩散语言模型的研究者提供以下建议:

  • 训练层面:应强化因果推理与解构化能力。在预训练和微调阶段引入具有强因果关系数据,如多步推理任务和轨迹,并大幅增加结构化内容的比重,如 JSON 代码、API 调用等,从源头提升模型对格式规范的理解,并建立对因果依赖关系的敏感性。

  • 解码层面:探索自适应的混合生成策略。模型应基于任务特性自适应地选择解码方式,对关键的推理步骤采用自回归解码确保因果连贯,而对于静态任务和需要全局视野的长文本生成,采用并行解码以提升效率;此外可在解码过程中引入格式约束和校正来弥补不确定性的短板。

  • 评估层面:建立面向智能体应用的基准体系。当前扩散模型的评估过度依赖 MMLU、GSM8K 等通用基准,这些基准无法反应智能体任务关于因果推理、多轮交互和工具调用等需求。研究者应报告模型在例如 DiffuAgent 智能体评估框架的结果,并建立覆盖真实应用场景的评估体系,避免「跑分高但不实用」的问题。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
随着日本0-2、波兰0-1,U20女足世界杯八强全诞生:2大亚洲劲旅在列

随着日本0-2、波兰0-1,U20女足世界杯八强全诞生:2大亚洲劲旅在列

侧身凌空斩
2026-09-18 02:34:41
别再吹世界第一了!1302根柱子,正在悄悄掀翻中国基建的老套路

别再吹世界第一了!1302根柱子,正在悄悄掀翻中国基建的老套路

刘哥谈体育
2026-09-18 01:42:36
严格按评选标准,金球奖只能是梅西的!

严格按评选标准,金球奖只能是梅西的!

老夏聊球
2026-09-19 00:08:03
怒其不争!中国男篮输球的同时,日本替补席做出哭鼻子的嘲讽动作

怒其不争!中国男篮输球的同时,日本替补席做出哭鼻子的嘲讽动作

十点街球体育
2026-09-18 23:29:04
“中国人不来也没关系”?打脸了!

“中国人不来也没关系”?打脸了!

环球时报国际
2026-09-17 17:15:36
王鹤棣报案风波再失控!发声惹众怒,医院下场,这次谁也'救'不了他

王鹤棣报案风波再失控!发声惹众怒,医院下场,这次谁也'救'不了他

错过美好
2026-09-17 15:14:20
黄宗泽餐厅怒吼服务员视频疯传,反转来得太快

黄宗泽餐厅怒吼服务员视频疯传,反转来得太快

浅遇时光
2026-09-17 09:58:45
快退休的同事在与我交接工作时忽然翻脸:关系从来不是单方面的,反思自己的时候,也要看清局面

快退休的同事在与我交接工作时忽然翻脸:关系从来不是单方面的,反思自己的时候,也要看清局面

LULU生活家
2026-09-18 19:59:43
万亿宁德时代迎至暗时刻:深陷舆论风暴,市值蒸发7000亿,理想、小米等多家车企“去宁化”,风波中的赛力斯坚守

万亿宁德时代迎至暗时刻:深陷舆论风暴,市值蒸发7000亿,理想、小米等多家车企“去宁化”,风波中的赛力斯坚守

金融界
2026-09-18 20:48:18
统一台湾后需多少驻军?香港人口753万,驻军约6000人,澳门人口68万,驻军不足千人,台湾面积是香港的32倍,保守估计,台湾驻军需6-8万人

统一台湾后需多少驻军?香港人口753万,驻军约6000人,澳门人口68万,驻军不足千人,台湾面积是香港的32倍,保守估计,台湾驻军需6-8万人

扶苏聊历史
2026-09-10 15:51:48
特朗普做出“疯狂决定”,成功让全世界破防了!外媒:中国又赢了

特朗普做出“疯狂决定”,成功让全世界破防了!外媒:中国又赢了

关权教授聊经济
2026-09-18 15:31:10
如果中国不让步,就驱逐中方外交官!日本话音刚落,空军王炸登场

如果中国不让步,就驱逐中方外交官!日本话音刚落,空军王炸登场

安珈使者啊
2026-09-18 09:57:19
白举纲敦煌婚礼刷屏!娱乐圈最稀缺的爱情:低调守护,岁岁安稳

白举纲敦煌婚礼刷屏!娱乐圈最稀缺的爱情:低调守护,岁岁安稳

传递满满正能量
2026-09-18 06:24:43
原来他们已离婚!如今一个坚持丁克不再婚,一个儿女双全幸福升级

原来他们已离婚!如今一个坚持丁克不再婚,一个儿女双全幸福升级

林雁飞
2026-09-17 18:37:00
前脚获评“江苏好人”,后脚涉嫌严重违纪违法:“好人校长”姚恒章落马,撕开了什么?

前脚获评“江苏好人”,后脚涉嫌严重违纪违法:“好人校长”姚恒章落马,撕开了什么?

迷世书童
2026-09-18 22:03:12
敬一丹送灵结束,才发现40岁无儿无女的女儿,早被她安排好后路

敬一丹送灵结束,才发现40岁无儿无女的女儿,早被她安排好后路

九号探秘人
2026-09-17 20:26:37
方昊:进球献给老婆和即将出生的孩子,感谢吴总把我带到球队

方昊:进球献给老婆和即将出生的孩子,感谢吴总把我带到球队

懂球帝
2026-09-18 22:03:17
梅西夺冠后,金球奖官方道贺:史上最成功的球员!

梅西夺冠后,金球奖官方道贺:史上最成功的球员!

历史第一人梅西
2026-09-18 10:56:33
广西“替人养子”事件冲上热搜:一个出轨女,害惨三代人……

广西“替人养子”事件冲上热搜:一个出轨女,害惨三代人……

桌子的生活观
2026-09-18 12:45:59
1年倒闭九万家,五个月亏损200万?昔日的暴利生意正批量“失联”

1年倒闭九万家,五个月亏损200万?昔日的暴利生意正批量“失联”

老沮系戏精北鼻
2026-09-18 14:45:02
2026-09-19 00:20:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14023文章数 142733关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

游戏
本地
旅游
艺术
公开课

《给他爱5》废弃“自由城”DLC可能会加入到《GTA6》中

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

旅游要闻

北京新增10处!国庆假期,一起到树底下放空如何?

艺术要闻

刘炜画了幅《我的风景》,1840万!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版