网易首页 > 网易号 > 正文 申请入驻

清华大学提出新方案,提升大模型多智能体推理能力!

0
分享至

近日,清华大学等机构的研究团队提出了MARSHAL框架。该框架利用强化学习,让大模型在策略游戏中进行自博弈(Self-Play)。实验表明,这种多轮、多智能体训练不仅提升了模型在游戏中的博弈决策水平,更将其推理能力有效泛化到了通用的多智能体系统:在如数学竞赛和专家级问答等一般推理任务中,显著提升了多智能体系统的整体表现。

  • 论文标题:MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
  • 论文链接:https://arxiv.org/abs/2510.15414
  • 项目主页:https://thu-nics.github.io/MARSHAL/
  • 代码开源:https://github.com/thu-nics/MARSHAL
  • 模型仓库:https://huggingface.co/collections/nics-efc/marshal

一、 背景与挑战

尽管 DeepSeek-R1 等大模型已在数学、问答等单轮、单智能体场景中,验证了可验证奖励强化学习(RLVR)对提升推理能力的巨大价值;但在多智能体系统(MAS)复杂的多轮、多智能体交互场景中,这一方法的应用仍处于探索阶段。具体而言,将 RLVR 拓展至多智能体领域面临着两大核心技术挑战:

  • 多轮交互的信用分配:现有的单轮 RLVR 方法难以精准地将最终结果回溯并分配给每一个具体的轮次或动作,进而影响了模型的有效学习。
  • 多智能体的优势估计:不同智能体通常具有高度的异构性,其在优势估计(advantage estimation)中的优势基准(baseline)存在显著差异,导致多智能体联合训练难以收敛,策略表现波动剧烈。

为了解决上述问题,为多智能体系统训练更强的推理模型,清华大学研究团队提出了MARSHAL(Multi-Agent Reasoning through Self-play witH strAtegic LLMs)框架,通过策略游戏中的多智能体自博弈和端到端强化学习,激发大模型的在通用多智能体系统中的推理决策能力。

图 1 MARSHAL 在策略游戏的表现及通用推理基准泛化性能

核心实验结果:

  • 策略游戏:多智能体博弈决策表现显著提升,测试游戏胜率提升高达28.7%。
  • 泛化表现:将模型集成至通用多智能体系统中时,在一般推理任务中展现出显著泛化性 ——AIME 准确率提升10.0%(AutoGen 框架 [1]);GPQA-Diamond 准确率提升7.6%(MAD 框架 [2]);所有基准测试平均提升3.5%。

二、MARSHAL 方法介绍

图 2 MARSHAL 框架概览

面向策略游戏自博弈中多轮次、多智能体训练的挑战,MARSHAL 基于 Group-Relative Policy Optimization (GRPO) 架构,提出了两项关键算法改进:

  • 轮次级优势估计器 (Turn-level Advantage Estimator):针对多轮交互中的信用分配问题,MARSHAL 摒弃了经典单轮 GRPO 粗糙的轨迹级评估,引入精细的轮次级(Turn-level)奖励机制,并设计了 “先求累计和再归一化(Sum-then-Normalize)” 的方法进行稳定的优势计算。
  • 分角色的优势归一化 (Agent-specific Advantage Normalization):针对角色异构性导致的回报分布差异,MARSHAL 实施了严格区分角色的归一化策略:在计算优势时,系统不再将所有智能体混为一谈,而是根据角色的不同(例如 “玩家 1” 与 “玩家 2”)将数据分组。

为了培养全面的多智能体推理能力,研究团队精心挑选了六款策略游戏(其中三款用于训练,另外三款用于测试),涵盖了从简单到复杂、从竞争到合作的多种博弈类型。

图 3 MARSHAL 使用的游戏集合

三、核心实验

研究团队以 Qwen3-4B 为基线模型,在三款训练游戏(Tic-Tac-Toe、Kuhn Poker、Mini Hanabi)中训练了两种类型的智能体:

  • 专家智能体 (Specialist):仅在单一游戏上训练。
  • 通用智能体 (Generalist):在所有三款游戏上混合训练。

游戏策略能力的泛化

MARSHAL 训练出的专家智能体在各自的同类型游戏中展现出出色的泛化性;通用智能体则在所有游戏类型中的综合表现最佳,在测试游戏中取得了高达28.7%的胜率提升。这些结果表明,模型并非仅仅记住了特定游戏的规则,而是真正掌握了通用的博弈逻辑(如 “先手优势利用”、“信息推断” 等),并能将其灵活泛化到全新的游戏环境中。

图 4 MARSHAL 专家智能体在各类策略游戏中的胜率对比

通用推理能力的泛化

这是本研究最核心的实验,研究团队将 MARSHAL 模型作为基座集成到主流的多智能体框架(MAD 和 AutoGen)中,测试其在7种数学和问答基准测试上的成绩,最终得到两个关键结论:

  • 在策略游戏中习得的多智能体博弈能力,能够跨域泛化到通用的多智能体系统中,提升系统在一般推理任务中的表现。综合表现最强的 MARSHAL 通用智能体在数学测试 AIME 和问答测试 GPQA 中分别取得高达10.0%和7.6%的提升;在所有测试中的平均提升高达3.5%。
  • 能力泛化领域高度对齐:在竞争性多智能体系统 MAD 中,竞争性游戏(Tic-Tac-Toe)训练的模型表现更优;而在合作性多智能体系统 AutoGen 中,合作性游戏(Hanabi)训练的模型表现更优。

图 5 MARSHAL 智能体在数学和问答推理测试中的泛化表现

以上实验结果强有力地证明了自博弈是提升多智能体系统推理能力的磨刀石。此外,在扩展到 8B 模型的实验中,MARSHAL 依然保持了强劲的增长势头,验证了该方法良好的可扩展性(Scalability)。

四、推理模式分析:模型学到了什么?

为了探究 MARSHAL 成功泛化的原因,研究团队从定性和定量两个维度进行了深入分析。

  • 定性分析:通过对思维链(Chain-of-Thought)的深入解读,研究发现游戏训练激发了模型两项关键的涌现能力:1)角色意识(Role-Awareness),根据自身角色调整决策策略;2)意图识别(Intent Recognition),在不确定信息场景中根据其他智能体的决策动作判断其意图。

图 6 推理模型定性分析

  • 定量分析(Quantitative Analysis):为了进一步量化 MARSHAL 带来的多智能体推理能力的提升,研究团队对多智能体系统进行了失败模式分析。结果显示,MARSHAL 将智能体间未对齐(Inter-Agent Misalignment)的情况减少了 11.5%,显著提升了模型在跨智能体的沟通效率和理解能力。

图 7 失败模式定量分析

五、消融实验

自博弈 vs 固定对手

与固定专家对手进行训练相比,自博弈展现出了不可替代的优势。实验发现,针对固定对手训练的模型容易对训练环境过拟合,在测试游戏中性能急剧下降。

图 8 MARSHAL 自博弈和固定对手训练方式在策略游戏中的对比

优势估计算法设计

研究团队通过逐步移除核心算法组件,验证了 MARSHAL 算法设计的必要性:1)轮次级优势估计的精细信用分配是处理长序列决策的关键;2)分角色归一化在角色回报差异大的竞争性游戏中(如 Tic-Tac-Toe)影响巨大,而在角色回报分布相似的合作游戏(如 Hanabi)中影响则相对较小。

图 9 MARSHAL 算法设计的消融实验

图 10 角色回报分布的差异性分析

六、总结

该项研究工作提出了MARSHAL框架,通过在策略游戏中进行自博弈,成功增强了大语言模型在多智能体系统中的推理能力,提高了其在一般推理任务中的表现。核心结论如下:

  • 验证了策略游戏自博弈的泛化性:在简单的策略游戏中通过自博弈习得的博弈技巧(如角色意识、意图识别)能够泛化到通用多智能体系统,在一般的推理任务中取得显著的效果提升。
  • 提出了有效的技术方案:通过轮次级优势估计和分角色的归一化等算法设计,为多轮、多智能体强化学习中的稳定训练提供了有效方案。

尽管目前主要聚焦于双人博弈,但 MARSHAL 为未来通向更复杂的 “社会沙盒”(如多智能体协作编程、搜索、科研等)指明了潜在方向:自博弈不仅是 AlphaGo 战胜人类的法宝,也能成为大模型迈向更高阶群体智能的关键引擎。

参考文献

[1] Wu, Qingyun, et al. "Autogen: Enabling next-gen llm applications via multi-agent conversation." COLM 2024.

[2] Liang, Tian, et al. "Encouraging divergent thinking in large language models through multi-agent debate." EMNLP 2024.

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
里夫斯:我不会像勒布朗或者东契奇那样领导湖人,我会忠于自己

里夫斯:我不会像勒布朗或者东契奇那样领导湖人,我会忠于自己

稻谷与小麦
2026-09-30 00:05:10
李现分享两年前“踩坑”经历:花一万多买的二手“99新”相机,到手镜头盖都盖不上,只用一次最后被折价2000元才退货

李现分享两年前“踩坑”经历:花一万多买的二手“99新”相机,到手镜头盖都盖不上,只用一次最后被折价2000元才退货

极目新闻
2026-09-29 20:19:37
吴石行刑前,据说汤恩伯两次向老蒋求情,蒋说:最多保障家眷周全

吴石行刑前,据说汤恩伯两次向老蒋求情,蒋说:最多保障家眷周全

优趣纪史记
2026-09-30 06:42:21
美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

吕醿极限手工
2026-08-27 14:18:48
峰哥刚刚杀入黄金,6天亏了4.4万,高呼对不起家人!但8月回血了111万

峰哥刚刚杀入黄金,6天亏了4.4万,高呼对不起家人!但8月回血了111万

金石随笔
2026-09-29 12:26:50
禁止携带!闸口海关在进境旅检渠道查获8只苏丹盾甲蜥

禁止携带!闸口海关在进境旅检渠道查获8只苏丹盾甲蜥

北青网-北京青年报
2026-09-29 11:03:08
中日激烈交锋,中方在联大发火了,2句话落下,怼得日本哑口无言

中日激烈交锋,中方在联大发火了,2句话落下,怼得日本哑口无言

瑛派儿老黄
2026-09-30 06:23:03
iPhone 18 Pro被指屏幕降级:可视角度色差显著,供应链大幅压价

iPhone 18 Pro被指屏幕降级:可视角度色差显著,供应链大幅压价

ZAKER科技
2026-09-29 10:50:06
外交部:敦促日本当政者以实际行动回归四个政治文件的初心和原点

外交部:敦促日本当政者以实际行动回归四个政治文件的初心和原点

新华社
2026-09-29 17:30:03
国际金银价格大跌,黄金跌4%

国际金银价格大跌,黄金跌4%

每日经济新闻
2026-09-29 07:49:18
刘欢为什么放着正经的艺术院校不去,跑到一所搞外贸的学校教音乐

刘欢为什么放着正经的艺术院校不去,跑到一所搞外贸的学校教音乐

荆楚寰宇文枢
2026-09-29 22:42:25
新股力勤资源上市交易,中签人数多,但中签股民弃购金额872万元!

新股力勤资源上市交易,中签人数多,但中签股民弃购金额872万元!

数据挖掘分析
2026-09-30 07:09:18
老人卖房替儿还贷百万元,儿子儿媳拿钱后与他断绝来往,老人起诉要钱,儿媳称微信说过“感谢爸爸鼎力相助”,足以说明钱是赠与;法院说法

老人卖房替儿还贷百万元,儿子儿媳拿钱后与他断绝来往,老人起诉要钱,儿媳称微信说过“感谢爸爸鼎力相助”,足以说明钱是赠与;法院说法

扬子晚报
2026-09-29 07:09:33
独属于你的心我会给,但你会珍惜吗?

独属于你的心我会给,但你会珍惜吗?

疾跑的小蜗牛
2026-09-29 19:36:51
鲁尼:即使曼城被剥夺2011-12赛季英超冠军,曼联也不配夺冠

鲁尼:即使曼城被剥夺2011-12赛季英超冠军,曼联也不配夺冠

懂球帝
2026-09-29 16:17:20
内地公安机关与香港警方联手打掉一跨境地下钱庄犯罪团伙

内地公安机关与香港警方联手打掉一跨境地下钱庄犯罪团伙

界面新闻
2026-09-29 20:33:42
老了肌肉流失怎么办?医生:2样东西必须吃,2件事做得越早越好

老了肌肉流失怎么办?医生:2样东西必须吃,2件事做得越早越好

健康之光
2026-09-28 19:00:12
林诗栋拿到冠军,秦志戬都不敢鼓掌?秦志戬给林诗栋鼓掌的那只手又紧急收回

林诗栋拿到冠军,秦志戬都不敢鼓掌?秦志戬给林诗栋鼓掌的那只手又紧急收回

蜜桔娱乐
2026-09-29 16:21:39
体内有结节的人,尽量少吃这5类“发物”,忍住不吃或有帮助!

体内有结节的人,尽量少吃这5类“发物”,忍住不吃或有帮助!

中医刘瑛大夫
2026-09-28 11:28:18
赔率突变!亚马尔赔率直线暴跌,与凯恩并列第一,金球奖悬念拉满

赔率突变!亚马尔赔率直线暴跌,与凯恩并列第一,金球奖悬念拉满

友谊第一
2026-09-29 14:15:28
2026-09-30 07:39:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14105文章数 142740关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

杭州女孩天天坐高铁去上海上班 通勤6小时每月花3000

头条要闻

杭州女孩天天坐高铁去上海上班 通勤6小时每月花3000

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

健康
房产
艺术
本地
公开课

洗脸越勤,痘痘反而越多?

房产要闻

三亚楼市下半场,被一次交付和一座艺术馆讲透了

艺术要闻

齐白石:没见过的东西,我绝不画!一句话,道出大师封神的秘密!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版