网易首页 > 网易号 > 正文 申请入驻

全面战胜ReAct!斯坦福全新智能体推理框架,性能提升112.5%

0
分享至


新智元报道

编辑:LRST

【新智元导读】斯坦福和MIT的研究团队推出了一种新的AI智能体推理框架ReCAP,在长上下文任务中全面超越了现有的主流框架ReAct,性能提升显著。ReCAP通过独特的递归树结构和三大机制,解决了大语言模型在复杂任务中常见的目标漂移、上下文断层和成本爆炸等问题。在多项基准测试中,ReCAP均取得了大幅领先的成绩,展现出强大的通用性和稳定性。尽管计算成本略有增加,但其在关键任务中的表现使其成为极具潜力的新一代通用推理架构。

自2022年ReAct框架提出以来,AI智能体推理领域便进入了百家争鸣的时代,各种复杂架构如雨后春笋般涌现。

然而,这些架构大多昙花一现,因其复杂的结构导致在更换评测基准时需要大幅修改示例,表现远不如ReAct稳定泛用,这也使得ReAct在过去三年中,成为了该领域事实上的主流与标杆。

但是,我们真的不能再做得更好了吗?

面对大模型在长上下文任务中走几步就忘的短期记忆顽疾,业界是否只能止步于此?

来自斯坦福大学与MIT的研究团队给出了肯定答案,正式发布的AI Agent推理新框架——ReCAP(递归上下文感知推理与规划),从真正意义上统一了序列推理和层级推理,在多种任务中全面战胜了ReAct,且继承了ReAct示例简单、高通用性,和即插即用的优势。


论文链接:https://arxiv.org/pdf/2510.23822

在严格遵循 pass@1(一次通过)的评测原则下,ReCAP在长序列具身任务Robotouille上相比ReAct基线取得了84.2%(同步)和112.5%(异步)的巨大性能提升。

长上下文任务的三大「死穴」

团队指出,当今大语言模型在执行复杂任务时普遍有三种问题:

  • 目标漂移(Goal Drift):执行几步后就逐渐忽略了原本的目标,使得执行结果与期望不符。

  • 上下文断层(Context Loss):高层的规划信息在长序列执行中丢失,导致高层思考与低层执行不协调。

  • 成本爆炸(Prompt Explosion):每次递归都重新铺开上下文示例和提示词,推理成本指数增长。


简单说,LLM就像一个短期记忆型天才,而主流推理框架各有局限:

  • 序列推理(例如Chain of Thoughts,ReAct)虽然上下文连贯,但常常因为任务太长导致目标漂移;

  • 层级推理(例如ADaPT,THREAD)将任务分解为子任务来明确目标,但给子任务单独分配上下文示例和提示词,导致上下文断层和成本爆炸。


ReCAP

让序列推理和层级推理有机结合


ReCAP的核心在于将一个有记忆、有反馈的递归树结构作为模型的工作记忆区,其三大机制环环相扣:

  • 计划前瞻分解(Recursive Task Decomposition with Plan-Ahead):模型首先生成一个完整的子任务列表,但只执行第一个子任务,完成后再动态优化后续计划。

  • 结构化父任务再注入(Consistent Multi-level Context and Structured Injection):整个执行流程只有一个上下文,由所有任务共享。每次子任务递归返回时,父任务会将自身的思考和计划再次注入上下文,使父任务在重新计划时可以参考上次的思维和执行结果,规划出能真正达成任务目标的底层操作。

  • 滑动窗口记忆(Sliding Window and Scalable Memory Efficiency):通过滑动窗口机制,在统一上下文中只保留最新关键历史,实现了内存占用可控的深度递归,从根本上杜绝了成本爆炸。


实验结果

长上下文任务性能大幅跃升


团队在多个典型长上下文推理基准上验证了ReCAP的效果。结果令人瞩目:

  • 在Robotouille(同步)上取得70%成功率,较ReAct(38%)提升84.2%

  • 在Robotouille(异步)上取得53%成功率,较ReAct(24%)提升112.5%

  • 在ALFWorld上取得91%成功率,稳定优于ReAct(84%)

  • 在SWE-bench Verified取得44.8%的成功率,优于ReAct基线(39.58%)

值得注意的是,团队在实验中始终秉持pass@1的实验原则,即不使用样本层面的重试、多数投票或者束搜索。这意味着ReCAP能在真实多步环境中,更好地保持目标一致性与执行连贯性——不仅「想得对」,还能「做得稳」。

ReCAP是除ReAct之外,又一个能够在具身推理、以及代码编辑这两种截然不同的任务上都取得稳健表现的通用推理架构。

论文中排除了THREAD、Reflexion等其他基线,因其在实验设置中难以稳定复现或与 pass@1 协议不兼容,这进一步凸显了ReCAP作为新一代通用推理基线的潜力。

优势与成本的权衡

任何强大的能力都伴随着成本。团队对此进行了透明分析:ReCAP的总计算成本约为ReAct的三倍。这主要来自于其核心的计划前瞻分解机制所额外需要的LLM调用。

然而,考虑到其在关键任务上带来的性能巨幅提升与目标一致性,这种成本的增加在对准确性要求高的实际应用中是可以接受的。这为开发者提供了一个清晰的性价比权衡选项。

递归,是通往通用智能的钥匙?

从人类思维到图灵机,递归始终是智能的底层逻辑。ReCAP的提出,可视为AI迈向通用推理系统的关键一步。

其潜力远不止于论文所验证的任务范畴。任何依赖复杂决策回路与长期上下文记忆的大型任务,都是ReCAP的理想应用场景。

例如在深度研究中自主遍历文献、整合多源信息并生成洞察报告;或在复杂软件工程中管理庞大代码库与依赖关系,推进需多步验证的系统项目。

长远来看,ReCAP的递归规划能力可以与空间智能相结合,解决更为复杂的现实世界问题。李飞飞教授近日指出,空间智能——即理解、推理并与三维世界交互的能力,是AI的下一个前沿。

ReCAP可以为具身智能机器人规划复杂的长期任务序列,而空间智能模型则负责处理实时感知与动作控制,二者结合实现机器人在动态环境中的自主规划与可靠执行。

随着代码的开源,一个更擅长长期规划、稳健执行的AI时代或许即将到来。

作者介绍

共同一作 Zhenyu Zhang, Tianyi Chen, Weiran Xu 均为斯坦福大学工程学院计算机系硕士研究生

Alex Pentland教授,麻省理工学院媒体实验室 创始人之一,美国国家工程院院士,Toshiba Professor at MIT,斯坦福大学 HAI Fellow。

Jiaxin Pei博士,斯坦福大学博士后研究员,研究兴趣集中在大语言模型、人机交互、Agentic AI,即将前往得克萨斯大学奥斯汀分校任教。

参考资料:

https://arxiv.org/pdf/2510.23822

秒追ASI

⭐点赞、转发、在看一键三连⭐

点亮星标,锁定新智元极速推送!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“神探”林宇辉称模拟画像与梅姨本人相似度达90%,曾多次更新是考虑其年龄增长

“神探”林宇辉称模拟画像与梅姨本人相似度达90%,曾多次更新是考虑其年龄增长

潇湘晨报
2026-03-21 14:38:09
价格飙涨6000%!原研药集体撤离中国的影响,开始出现了...

价格飙涨6000%!原研药集体撤离中国的影响,开始出现了...

牛锅巴小钒
2026-03-21 19:20:35
北京这夜:章子怡脸肿撞脸倪萍,刘浩存好土 周冬雨靠几百裙子出

北京这夜:章子怡脸肿撞脸倪萍,刘浩存好土 周冬雨靠几百裙子出

阿伧说事
2026-03-21 23:51:30
“永远不要和任何人修复关系,无论是谁,人和人的关系只有一次”

“永远不要和任何人修复关系,无论是谁,人和人的关系只有一次”

衷曲无闻
2026-03-20 21:31:55
人贩子“梅姨”落网,和画像判若两人,她拐卖孩子的数量能判死刑

人贩子“梅姨”落网,和画像判若两人,她拐卖孩子的数量能判死刑

汉史趣闻
2026-03-21 20:38:28
惊心动魄!这一幕让我们更明白中国为什么必须强大

惊心动魄!这一幕让我们更明白中国为什么必须强大

补壹刀
2026-03-21 22:27:48
路虎车主把手伸到举报者单位,人民日报发声:势力再大,也没用!

路虎车主把手伸到举报者单位,人民日报发声:势力再大,也没用!

奇思妙想草叶君
2026-03-21 14:39:01
鹿晗关晓彤再爆猛料,热搜都炸了

鹿晗关晓彤再爆猛料,热搜都炸了

美芽
2026-03-21 18:02:41
伊方:击中F-16战机,已摧毁200多架飞行器!伊朗投入全新进攻战术和更现代化系统,发动大规模打击!伊朗先进导弹有多难拦?专家解读

伊方:击中F-16战机,已摧毁200多架飞行器!伊朗投入全新进攻战术和更现代化系统,发动大规模打击!伊朗先进导弹有多难拦?专家解读

每日经济新闻
2026-03-21 22:28:34
女子谈释永信,她们姐妹住少林寺3天,一个个都抢着要往他房间跑

女子谈释永信,她们姐妹住少林寺3天,一个个都抢着要往他房间跑

皮蛋儿电影
2026-03-21 19:50:52
笑掉大牙!伊朗空天司令登上国家电视台,怕美以斩首不敢露真容

笑掉大牙!伊朗空天司令登上国家电视台,怕美以斩首不敢露真容

老马拉车莫少装
2026-03-21 17:30:29
突发!美国宣布批准临时交付和销售滞留海上的伊朗石油,预计将新增1.4亿桶

突发!美国宣布批准临时交付和销售滞留海上的伊朗石油,预计将新增1.4亿桶

每日经济新闻
2026-03-21 08:11:08
黄晓明带儿子和妈妈包饺子!摘了假发套发量堪忧,儿子长得太像baby

黄晓明带儿子和妈妈包饺子!摘了假发套发量堪忧,儿子长得太像baby

八卦王者
2026-03-21 22:03:13
这跟不穿有啥区别?黄多多穿三点式比基尼,却被200斤闺蜜抢风头

这跟不穿有啥区别?黄多多穿三点式比基尼,却被200斤闺蜜抢风头

涵豆说娱
2026-03-20 10:34:12
正部级高官任上落马,此前曾受过党内处分

正部级高官任上落马,此前曾受过党内处分

中国新闻周刊
2026-03-21 17:11:03
64118人!工体再创上座率纪录,中超历史第2,仅少3439人

64118人!工体再创上座率纪录,中超历史第2,仅少3439人

奥拜尔
2026-03-21 17:17:59
刘诗诗和唐嫣冲上热搜!曝离婚分割财产完毕,为争抚养权做出妥协

刘诗诗和唐嫣冲上热搜!曝离婚分割财产完毕,为争抚养权做出妥协

离离言几许
2026-03-20 15:24:58
大震动!黄金创43年最大暴跌,股油齐乱,中东战火下全球市场慌了

大震动!黄金创43年最大暴跌,股油齐乱,中东战火下全球市场慌了

魏家东
2026-03-21 12:55:03
两年巨亏超2.5亿,95后女董事长因涉嫌信息披露违法违规被立案

两年巨亏超2.5亿,95后女董事长因涉嫌信息披露违法违规被立案

三湘都市报
2026-03-21 09:30:32
劲报!伊朗又一高官遭斩首,川普痛骂北约盟友是“懦夫”

劲报!伊朗又一高官遭斩首,川普痛骂北约盟友是“懦夫”

史政先锋
2026-03-21 14:41:41
2026-03-22 04:00:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
14777文章数 66705关注度
往期回顾 全部

科技要闻

宇树招股书拆解,人形机器人出货量第一!

头条要闻

伊朗发射3800公里射程的导弹 最令美军战栗的细节披露

头条要闻

伊朗发射3800公里射程的导弹 最令美军战栗的细节披露

体育要闻

谁在决定字母哥未来?

娱乐要闻

田栩宁终于凉了?出轨风波影响恶劣

财经要闻

通胀警报拉响,加息潮要来了?

汽车要闻

小鹏汽车2025年Q4盈利净赚3.8亿 全年营收767亿

态度原创

艺术
亲子
时尚
教育
手机

艺术要闻

斯托扬画作:她们的眼神能勾动你的心!

亲子要闻

什么牌子驼奶粉好?2026中国驼奶品牌评测,原生营养无可挑剔

这个趋势好适合亚洲人!不用花大钱也能跟

教育要闻

南师附中举行2026年31公里步行者行动

手机要闻

终端市场集体喊“涨” 手机面板持续走“跌”

无障碍浏览 进入关怀版