当前,多智能体系统(Multi-Agent Systems, MAS)已经成为提升大模型复杂任务能力的一条重要路径。它通过规划器、判别器、求解器、专家模型、工具调用等不同角色,将单个模型难以完成的任务拆解成一系列协作过程。但现有多智能体系统大多仍然依赖显式文本在智能体之间传递信息,这会带来较高的 token 成本和推理延迟等问题。
本文介绍一篇来自 UIUC、Stanford、NVIDIA、MIT 等机构联合完成的工作:RecursiveMAS,该框架尝试把递归语言模型中的“循环计算”思想从单模型扩展到整个多智能体系统中。其核心做法是使用轻量级 RecursiveLink 模块,让多个异构智能体在潜空间中递归传递 latent thoughts,并通过 Inner-Outer Loop 训练实现系统级协同优化。实验结果表明,RecursiveMAS 在数学、科学、医学、搜索和代码生成等 9 个 benchmark 上,相比强单智能体、多智能体和递归计算基线性能平均提升了 8.3%,同时带来了 1.2× 到 2.4× 的端到端推理加速效果。
![]()
论文题目: Recursive Multi-Agent Systems 文章链接: https://arxiv.org/abs/2604.25917 项目主页: https://recursivemas.github.io一、引言
设计多智能体系统的基本思路,是把不同模型组织成一个协作结构,让每个智能体承担特定的角色。例如在序列推理中,Planner 负责拆解问题,Critic 负责检查中间答案,Solver 负责给出最终结果。在混合专家式协作中,不同领域专家可以分别处理数学、代码、科学等子问题,再由 Summarizer 汇总输出。相比单模型直接生成答案,这类结构更容易利用模型之间的互补能力。
![]()
如上图所示,本文关注的不是再增加一个专家模型,也不是继续优化某个单独智能体能带来多少性能提升,而是把整个多智能体系统看作一个可以递归缩放的计算单元。通过分析具体的实验结果,作者总结了现有MAS系统普遍存在的三个瓶颈如下:
(1)文本交互带来很高的推理成本。多智能体协作通常要求每个智能体生成完整的中间文本,再由下一个智能体读取并继续推理。随着递归轮数增加,中间文本会不断累积,推理时间和 token 成本也会快速上升。
(2)Prompt 级优化无法真正改进智能体本身。许多方法通过迭代修改上下文或提示词来改善协作,但这种方式主要改变的是输入格式,而不是系统内部的信息流。智能体之间的协作仍然停留在读写文本的层面,而不是在表示空间中进行优化。
(3)直接训练整个多智能体系统成本很高。不同智能体可能来自不同模型家族(模型规模不同。如果对所有模型参数进行联合训练,不仅显存和计算成本高,也很难稳定地分配跨智能体、跨轮次的学习信号。
围绕上述问题,RecursiveMAS 将多智能体协作看作是一种递归计算形式。它不再让智能体反复写出中间文本,而是让智能体在潜空间中交换表示,并只在最后一轮由最终智能体解码输出。
二、本文方法
本文方法的核心目标,是将整个多智能体系统建模为一个统一的潜空间递归计算过程。RecursiveMAS 把每个智能体类比为递归语言模型中的一层,不同智能体之间通过 RecursiveLink 连接,系统在多个递归轮次中持续传递和修正 latent thoughts。最终,只有最后一个智能体在最后一轮把潜空间结果解码为文本答案。
![]()
上图展示了 RecursiveMAS 的整体框架,系统内部包含两类 RecursiveLink,一类是智能体内部的 Inner Link,用于支持该智能体在潜空间中生成连续 latent thoughts,另一类是智能体之间的 Outer Link,用于把一个智能体的隐藏表示映射到下一个智能体的输入空间。这两个模块共同解决了一个关键问题:如何让原本只能通过文本协作的异构智能体,在连续潜空间中形成可递归的信息流。
2.1 使用 RecursiveLink 连接智能体的潜空间
RecursiveLink 是本文最核心的连接模块,对于单个智能体内部的潜空间推理,作者使用 Inner Link 将最后一层隐藏状态重新映射回输入空间,使模型可以继续以 latent thought 的形式自回归生成:
![]()
其中 表示当前隐藏状态, 是非线性激活函数。这个结构可以理解为一个两层残差投影模块,残差分支保留原始语义,投影分支学习输出空间到输入空间之间的分布对齐。当信息需要从一个智能体传递到另一个智能体时,系统使用 Outer Link 处理异构模型之间的维度和分布差异:
![]()
其中 负责将源智能体表示映射到目标智能体的隐藏空间。由于不同智能体可能来自 Qwen、Llama、Gemma、Mistral 等不同模型家族,Outer Link 可以提供一个轻量级接口,使跨模型协作不再依赖中间文本翻译。
![]()
RecursiveLink的具体细节如上图所示,其只含有少量的可训练连接参数,同时保留输入表示中的原始语义。
2.2 将多智能体协作组织成递归循环形式
在 RecursiveMAS 中,每个智能体会先基于自己的输入上下文和任务角色生成 latent thoughts。以第一个智能体为例,给定问题和角色指令对应的输入嵌入,模型前向计算得到最后一层隐藏状态,再通过 Inner Link 映射回输入空间并继续生成下一步的嵌入特征。这个过程可以写作:
![]()
其中 表示当前智能体模型, 表示已有输入嵌入, 是上一时刻的 latent thought。与标准自回归解码不同,这里不需要每一步都投影到词表空间生成 token,而是直接在连续表示空间中推进。当一个智能体完成内部 latent thoughts 生成后,Outer Link 会把这组潜表示传递给下一个智能体。下一个智能体再结合自己的角色指令和前一智能体传来的表示继续推理。系统依次经过所有智能体后,最后一个智能体的 latent outputs 会被传回第一个智能体,从而闭合整个递归循环。在中间递归轮次中,所有协作都发生在潜空间中,文本只在最后一轮被解码出来。
2.3 使用 Inner-Outer Loop 训练整个系统
为了让递归协作可以不断迭代,作者提出了一种两阶段训练流程,具体循环过程如下图所示。
![]()
第一阶段是模型级 Inner-Loop 训练,目标是让每个智能体的 Inner Link 先具备稳定的潜空间生成能力。给定训练样本中的标准答案 ,并将答案通过该智能体的输入嵌入层得到语义目标,并用余弦距离训练 Inner Link:
![]()
这个损失鼓励 Inner Link 生成的 latent thoughts 接近真实答案在输入嵌入空间中的语义分布。第二阶段是系统级 Outer-Loop 训练,此时整个 MAS 会沿递归循环展开多个轮次,最后一轮生成文本答案,并使用交叉熵损失训练跨智能体的 Outer Link:
![]()
其中 表示第 个递归轮次下的系统状态, 是总递归轮数。训练时完整保留跨智能体、跨递归轮次的计算图,因此最终答案的损失可以反向传播到各个 Outer Link。这使得 RecursiveMAS 可以根据全局任务结果分配协作信用,而不是只对某个单独智能体做局部微调。
三、实验结果
本文的实验主要在 4 种不同的协作模式下进行,包括 Sequential Style、Mixture Style、Distillation Style 和 Deliberation Style,并覆盖 MATH500、AIME2025、AIME2026、GPQA-Diamond、MedQA、LiveCodeBench、MBPP Plus、HotpotQA 和 Bamboogle 等 9 个 benchmark,和现有单智能体、多智能体和递归计算基线进行了性能对比。
3.1 RecursiveMAS 在多任务上取得稳定提升
在相同训练预算和相同模型设置下,RecursiveMAS 在多个任务上表现出明显优势。与单模型 LoRA、Full-SFT、Mixture-of-Agents[1]、TextGrad[2]、LoopLM[3] 和 Recursive-TextMAS 等方法相比,RecursiveMAS 在递归轮数 时性能最佳。
![]()
具体结果如上表所示,RecursiveMAS 的优势不是来自某一个单独任务,而是在数学推理、科学问答、代码生成和医学问答上都获得性能提升。
3.2 递归层次越深,潜空间协作的效率优势越明显
为了比较潜空间递归和文本递归的性能,作者也构造了 Recursive-TextMAS 来作为基线方法。该基线保持相同的多智能体结构和递归预算,但智能体之间通过显式文本传递信息。结果显示,随着递归轮数从 增加到 ,RecursiveMAS 的准确率优势和效率优势都更加明显。
![]()
上表结果表明,在递归轮数 时,RecursiveMAS 已经可以带来平均 1.2× 的端到端推理加速,并减少 34.6% token 使用量。当递归轮数增加到 和 时,平均推理加速分别扩大到 1.9× 和 2.4×,token 使用量减少幅度也扩大到 65.5% 和 75.6%。这验证了本文的核心假设:如果中间协作不再反复写成文本,递归越深,潜空间交互相对文本交互的优势就越明显。
![]()
image.png
具体的 token 消耗情况如上图所示,文本式 MAS 的开销会随着轮次增加快速累积,而 RecursiveMAS 只在最后一轮解码文本,中间轮次主要进行潜空间变换。因此,它在深递归设定下可以极大的节省token成本。
3.3 RecursiveLink 带来更低的训练成本
作者进一步分析了 RecursiveLink 的结构和训练成本。在模块设计上,两层残差结构取得了最好的整体效果(实验结果如下表所示),在 MATH500、GPQA-Diamond 和 LiveCodeBench 上分别达到 88.0、66.2 和 42.9。相比不使用残差或使用更简单映射的变体,残差连接能够保留原始语义,并让投影模块专注于分布对齐。
![]()
在训练成本方面,RecursiveMAS 只训练 13.12M 参数,占总参数的 0.31%,GPU 显存约 15.29GB,训练成本约 4.27 美元,平均准确率为 74.9。相比之下,LoRA 需要 21.67GB 显存,训练成本约 6.64 美元,平均准确率为 66.9。Full-SFT 需要 41.40GB 显存,训练成本约 9.67 美元,平均准确率为 68.6。
![]()
上表结果说明,RecursiveMAS 的优势不只是推理阶段更省 token。由于其在训练过程中冻结了所有 LLM agent 的参数,只训练 RecursiveLink,系统可以用更少显存和更低成本获得更高的准确率。
四、总结
本文提出了一种全新的多智能体系统框架RecursiveMAS,其将多智能体系统的协作方式从文本级交互推进到潜空间递归计算形式,并通过 Inner Link 支持单个智能体生成 latent thoughts,通过 Outer Link 连接异构智能体,并用 Inner-Outer Loop 训练实现跨轮次、跨智能体的统一优化。实验结果表明,这种设计可以在多个任务和多种协作结构中同时提升准确率、推理速度和 token 效率。
参考
[1] J. Wang, W. Jue, B. Athiwaratkun, C. Zhang, and J. Zou. Mixture-of-agents enhances large language model capabilities. In The Thirteenth International Conference on Learning Representations, 2025b.
[2] M. Yuksekgonul, F. Bianchi, J. Boen, S. Liu, P. Lu, Z. Huang, C. Guestrin, and J. Zou. Optimizing generative ai by backpropagating language model feedback. Nature, 639(8055):609–616, 2025.
[3] R.-J. Zhu, Z. Wang, K. Hua, T. Zhang, Z. Li, H. Que, B. Wei, Z. Wen, F. Yin, H. Xing, et al. Scaling latent reasoning via looped language models. arXiv preprint arXiv:2510.25741, 2025.
Illustration From IconScout By IconScout Store
AI 学术长跑中的女性力量与科研定力:与 6 位高校老师的线上闭门交流
北京时间8月11日(周二) 晚20:00截止报名
详情点击图片跳转
-The End-
本周上新!
扫码观看!
“AI技术流”原创投稿计划
TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。
投稿内容
// 最新技术解读/系统性知识分享 //
// 前沿资讯解说/心得经历讲述 //
投稿须知
稿件需要为原创文章,并标明作者信息。
我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励
投稿方式
发送邮件到
yimingzhang@thejiangmen.com
或添加工作人员微信(aceyiming)投稿,沟通投稿详情
关于我“门”
将门是一家以专注于数智核心科技领域的新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。
将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。
如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:
bp@thejiangmen.com
![]()
点击右上角,把文章分享到朋友圈
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.