网易首页 > 网易号 > 正文 申请入驻

IJCAI 2024 | 多智能体强化学习新范式:个性化训练与蒸馏执行

0
分享至

大家好,这里和大家分享一篇我们在多智能体强化学习(MARL)领域关于新的训练范式的文章(Accepted by IJCAI 2024)。

这篇文章展示了如何通过个性化的集中式训练得到一个强大的集中式执行算法,然后通过知识蒸馏的方式使得智能体决策既受益于全局信息同时又能实现分散式执行,从而提升多智能体系统的协作性能。

论文标题: PTDE: Personalized Training with Distilled Execution for Multi-Agent Reinforcement Learning 论文链接: https://arxiv.org/pdf/2210.08872 代码链接: https://github.com/AntNLP/nope_head_scale

一、研究背景与挑战

在现实世界的许多任务中,如多机器人导航、避障、无人机路径规划等,都可以建模为多智能体系统的决策问题。这些场景通常受到局部可观测和分散式执行的约束。

最常见的范式是集中式训练分散式执行(Centralized Training with Decentralized Execution, CTDE),这种范式在训练时利用全局信息促进各个智能体实现协作行为,在执行时只使用局部信息,是观测信息受限情况下的一种很好的训练 & 执行范式。

但如何在满足 CTDE 范式的前提下,还能在分散式决策过程中充分受益于全局信息,进而提升多智能体的协作表现呢?本文提出了一种新颖的范式(Personalized Training with Distilled Execution, PTDE)来实现这一目标。

二、PTDE的核心思想

PTDE 范式符合 CTDE 的要求,但与传统 CTDE 不同的是 PTDE 强调为每个智能体提供个性化的全局信息,并通过知识蒸馏将这些个性化的全局信息通过智能体的局部信息预测得到。这种方法不仅大大提升了智能体集中式执行的性能,而且转变为分散式执行时的性能下降也是在可接受范围内的。

三、研究方法

PTDE 包含两个训练阶段。

第一阶段,通过全局信息个性化(GIP)模块为每个智能体提供个性化的全局信息 。(Figure 2)

全局信息个性化(GIP)模块

第二阶段,使用知识蒸馏技术,将个性化的全局信息 蒸馏到仅依赖于智能体局部信息的学生网络中,即学生网络根据局部信息生成个性化全局信息的替代品 。(Figure 4)

特定化的知识蒸馏

经过两阶段的训练后,在执行阶段用 替代 ,就可以实现完全分散式的执行并且受益于特定化的全局信息。

两阶段训练&分散式执行

四、实验结果

我们在 StarCraft II、Google Research Football 和搜索排序(LTR)等不同的测试平台上进行了广泛的实验。

实验结果表明:

  • unified 的全局信息对多智能体的协作不一定起到积极作用。

  • 个性化的全局信息相比于 unified 的全局信息来说,一般更有利于多智能体的协作。

  • 知识蒸馏后,由集中式执行转变为分散式执行的性能下降是在可接受范围内的。

  • 基于 PTDE 范式的算法可以在不同类型的环境 & 任务中取得不错的性能。

  • PTDE 范式可以很好地适配现有的 MARL 算法,如基于值分解的 QMIX、VDN,以及基于 Actor-Critic 架构的 MAPPO 等。

以下是本文实验部分的一些基本数据,分别是在 StarCraft II、Google Research Football 和搜索排序(LTR)多个任务上的结果:

星际争霸实验结果

谷歌足球实验结果

搜索排序实验结果

文章的实验部分展示了更多充分且详细的实验曲线&结果分析,具体可进一步参考原文( http://arxiv.org/pdf/2210.08872 )。

五、结论与展望

PTDE 作为一种新的多智能体强化学习范式,通过个性化的全局信息和知识蒸馏技术,有效地提升了多智能体系统的协作决策能力。

以上就是对 PTDE: Personalized Training with Distilled Execution for Multi-Agent Reinforcement Learning(http://arxiv.org/pdf/2210.08872)这篇文章的分享,如果感兴趣的话推荐阅读原文(http://arxiv.org/pdf/2210.08872)。如果想要讨论任何问题或者有任何建议,欢迎交流!

此外,还要宣传一下我们将 MARL 应用于搜索结果多样性排序(Search Result Diversification, SRD)的文章,探索 MARL 在更多场景应用的可能性:

MA4DIV: Multi-Agent Reinforcement Learning for Search Result Diversification https://arxiv.org/pdf/2403.17421.pdf

llustration From IconScout By IconScout Store

-The End-

扫码观看!

本周上新!

“AI技术流”原创投稿计划

TechBeat是由将门创投建立的AI学习社区(

www.techbeat.net
) 。 社区上线500+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。

投稿内容

// 最新技术解读/系统性知识分享 //

// 前沿资讯解说/心得经历讲述 //

投稿须知

稿件需要为原创文章,并标明作者信息。

我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励

投稿方式

发送邮件到

chenhongyuan@thejiangmen.com

或添加工作人员微信(chemn493)投稿,沟通投稿详情;还可以关注“将门创投”公众号,后台回复“投稿”二字,获得投稿说明。

关于我“门”

将门是一家以专注于数智核心科技领域新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。

将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。

如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:

bp@thejiangmen.com

点击右上角,把文章分享到朋友圈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
陕西女子被丈夫和闺蜜背叛案二审开庭

陕西女子被丈夫和闺蜜背叛案二审开庭

黄河新闻网吕梁
2026-04-14 11:26:44
新华社18秒视频,让美国前高官“焦虑”了

新华社18秒视频,让美国前高官“焦虑”了

新华社
2026-04-14 20:53:52
广东一女子从窗户抛撒大量港币引争抢!已查明:因亲属病重情绪波动,钱币已归还

广东一女子从窗户抛撒大量港币引争抢!已查明:因亲属病重情绪波动,钱币已归还

都市快报橙柿互动
2026-04-14 23:04:50
记者:知情人士透露张涵泊改名为李沂泽,家庭变故带来的改名行为

记者:知情人士透露张涵泊改名为李沂泽,家庭变故带来的改名行为

狼叔评论
2026-04-14 21:20:16
暴跌!价格几乎腰斩!一女子连吃两天,剧烈腹痛胃底被堵死!很多人爱吃

暴跌!价格几乎腰斩!一女子连吃两天,剧烈腹痛胃底被堵死!很多人爱吃

南方都市报
2026-04-13 16:44:33
27岁演员周墨患脑梗死!185公分体重曾达60斤,疑与熬夜劳累有关

27岁演员周墨患脑梗死!185公分体重曾达60斤,疑与熬夜劳累有关

裕丰娱间说
2026-04-14 11:05:13
多个省级政府领导班子调整

多个省级政府领导班子调整

上观新闻
2026-04-14 17:04:07
最新数据:美国从中国进口的智能手机比例从90%骤降至25%,组装中心加速转移

最新数据:美国从中国进口的智能手机比例从90%骤降至25%,组装中心加速转移

风向观察
2026-04-14 14:25:12
疯狂!种马男星沃伦睡过12775名女友,性欲成瘾缠着女友不让下床

疯狂!种马男星沃伦睡过12775名女友,性欲成瘾缠着女友不让下床

钱小刀娱乐
2026-04-14 10:39:13
曝大闹昆明候机厅:狂踹工作人员,闹事母女正脸曝光,孩子受牵连

曝大闹昆明候机厅:狂踹工作人员,闹事母女正脸曝光,孩子受牵连

奇思妙想草叶君
2026-04-14 17:03:12
人民的名义:高小琴出狱后重返孤鹰岭,从石缝里摸出了一个U盘

人民的名义:高小琴出狱后重返孤鹰岭,从石缝里摸出了一个U盘

清茶浅谈
2026-03-08 00:50:03
许家印当庭认罪,家族还有多少资产没追回?

许家印当庭认罪,家族还有多少资产没追回?

凤凰网财经
2026-04-14 12:59:36
单场狂卖10亿!薇娅之后,直播圈终于迎来新一姐?

单场狂卖10亿!薇娅之后,直播圈终于迎来新一姐?

雷科技
2026-04-14 11:36:15
刘雨鑫吃了6000家餐厅、走遍几十个国家,他的钱其实就3个来源

刘雨鑫吃了6000家餐厅、走遍几十个国家,他的钱其实就3个来源

老吴教育课堂
2026-04-14 07:44:56
炸裂!胡锡进正式成为某汽车品牌代言人

炸裂!胡锡进正式成为某汽车品牌代言人

互联网品牌官
2026-04-14 18:33:54
网曝钟丽缇代孕要了个男孩,老公张伦硕态度坚决,二人备孕近10年

网曝钟丽缇代孕要了个男孩,老公张伦硕态度坚决,二人备孕近10年

萌神木木
2026-04-14 17:36:04
后续!孕妇花198买水果被骂:已终止妊娠并准备离婚,老公崩溃了

后续!孕妇花198买水果被骂:已终止妊娠并准备离婚,老公崩溃了

米果说识
2026-04-14 19:52:28
许家印大概不会活着走出监狱

许家印大概不会活着走出监狱

深度财线
2026-04-14 14:50:07
赛力斯汽车“车载便器”专利正式获批:可解决长途出行内急需求

赛力斯汽车“车载便器”专利正式获批:可解决长途出行内急需求

IT之家
2026-04-14 15:10:22
46岁广告研究学者、成都锦城学院广告系原系主任聂鑫鑫逝世

46岁广告研究学者、成都锦城学院广告系原系主任聂鑫鑫逝世

澎湃新闻
2026-04-14 16:42:27
2026-04-15 01:55:00
将门创投 incentive-icons
将门创投
加速及投资技术驱动型初创企业
2342文章数 596关注度
往期回顾 全部

科技要闻

离职同事"炼化"成AI?这届公司不需要活人了

头条要闻

54岁班主任带15岁女孩到宾馆开房猥亵:将她压到床上

头条要闻

54岁班主任带15岁女孩到宾馆开房猥亵:将她压到床上

体育要闻

带出中超最大黑马!他让球迷们“排队道歉”

娱乐要闻

网曝钟丽缇代孕要了个男孩 备孕近10年

财经要闻

许家印认罪,他和恒大还有多少欠债?

汽车要闻

售12.99万起/续航2000km 风云T9L上市

态度原创

手机
教育
房产
时尚
健康

手机要闻

颜值天花板!OPPO A6s Pro发布:首销1999元起 六年流畅

教育要闻

他们眼里的光被点燃!中华中学首届南大班学习成果汇报

房产要闻

改善标杆,1.5w+起横扫国兴!海口楼市,打出最猛一张牌!

坏事做尽的疯女人,集体翻红了

干细胞抗衰4大误区,90%的人都中招

无障碍浏览 进入关怀版