网易首页 > 网易号 > 正文 申请入驻

迈向长程智能体,人大高瓴发布149页全景综述

0
分享至



过去几年,大模型已经从单轮聊天机器人,快速演变为软件工程、深度检索、计算机操作、多模态交互与科学发现中的决策核心。新的问题随之出现:一个智能体即使单步表现足够聪明,能否在数百、数千次相互依赖的行动中始终记得目标、修正错误、管理上下文,并可靠安全地把任务做完?

这正是长程智能体(Long-Horizon Agents)研究要回答的问题。在智能体能力快速演进的今天,长程能力正日益成为其进入真实生产环境的核心瓶颈。依据 METR 的测量:在约 50% 成功率下,前沿智能体完成软件工程类任务的 “人类专家等效时长” 已从早期模型的秒级提升到十余小时。如图 1 所示,该时间跨度大约每 7 个月翻一倍;从 2023 年后,翻倍周期进一步缩短至约 4 个月,这说明智能体的长程能力仍处在高速扩展阶段。



图 1 前沿智能体可完成任务的时间跨度持续增长

在本文中,我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。为理理清这一局面,这篇 149 页综述系统梳理超过 900 项研究、系统与工程实践,首次以「外部脚手架工程 × 内部模型优化」的协同演化视角,给出长程智能体的统一定义、完整分类与未来路线图。



  • 论文标题:Towards Long-Horizon Agents: A Survey
  • 项目主页:https://long-horizon-agents.github.io/
  • 论文链接:https://openreview.net/forum?id=HyhfhlbWGh
  • 项目仓库:https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents

目前该综述刚发布就在小红书、GitHub、X 等社交平台上收获极高的关注度与反响!



为什么长程任务难:

单步错误的积累会导致整条轨迹失控

长程任务的难点并不只是某一步是否答对,而是大量紧密耦合的步骤必须组成一条连贯轨迹。单步看似微小的偏差,在长链条中会被反复继承和放大。论文将典型失败归纳为三类:

  • 目标漂移与误差累积:执行数千步后,Agent 逐渐偏离最初目标;局部错误不断叠加最终把整条轨迹带向错误方向。
  • 上下文腐化与窗口压力:上下文并非越长越好。随着历史推理轨迹和工具输出的不断堆积,模型可能会出现性能骤降,也可能因感知到窗口将满而过早结束任务。
  • 稀疏、延迟奖励与不可逆行动:很多任务只在最后给出奖励信号,这使得中间决策难以获得准确归因;而任务执行过程越长,出现误删数据、错误授权或错误操作等不可逆操作的风险越高。

这意味着,单纯扩大参数量或上下文窗口并不能解决全部问题。一个模型即使拥有更强推理能力,如果缺少计划维护、状态持久化、工具治理、验证和恢复机制,仍可能在长轨迹中迅速失控。

核心论点:

智能体外部和内部协同进化

基于上述挑战,本综述提出的核心论点:“长程智能体能力” 是系统级能力,它源于外部 “脚手架工程(Harness Engineering)” 与内部 “模型优化(Model Optimization)” 的协同演进。

理解长程智能体的关键是把视线从模型单体移向由模型与 Harness 共同构成的完整系统。模型提供推理和行动的策略;而 Harness 则负责进一步支持模型决策的执行,包括组织上下文、维护状态、调度工具、编排流程,并对关键步骤进行验证与恢复。二者共同决定智能体能否沿着一条漫长而相互依赖的轨迹稳定前进。因此,长程能力应被视为整个 Model-Harness 系统的属性,而不是基础模型的一项孤立指标。

论文进一步提出一条双向演化路径:如图 2 所示,Harness Engineering 先把计划、记忆、工具和验证等能力外置,用工程手段迅速拓展模型的能力边界;系统在真实交互中积累的轨迹与反馈,再通过 Model Optimization,用数据 / 环境构造、微调、强化学习、蒸馏和自进化等策略逐步沉淀到模型内部。模型变强后,又能驾驭更复杂的 Harness。外部能力扩展与内部能力吸收由此形成持续循环。



图 2 长程智能体研究全景:外部脚手架工程与内部模型优化共同进化

三层长程阶梯:从长窗口推理,

到跨会话记忆,再到跨任务泛化

本论文不以 “运行时长” 作为长程任务的唯一标准,而是考察任务是否包含大量相互依赖的逻辑决策,以及这些依赖需要跨越多大的执行边界。如图 3 琐事,本文提出 H1 - H3 三层任务与 C1 - C3 三层能力的阶梯框架:

任务层级:

  • H1|窗口内任务:单上下文窗口内完成,但不是一次回答就结束;须在持续交互中,把相互依赖的决定组成连贯轨迹。
  • H2|跨窗口 / 跨会话任务:远超单窗口或单会话(常持续数小时至数天);须压缩上下文,并在中断或交接后恢复进度。
  • H3|跨任务流:任务持续到来,总目标跨越多个子任务与环境;要求持久运行,而非封闭的一次性回合。

能力层级:

  • C1|交互式推理(对 H1):规划 — 行动 — 观察 — 修正,维持连贯路径。
  • C2|状态与记忆(对 H2):在 C1 之上,读写记忆、建检查点、可靠恢复。
  • C3|经验积累(对 H3):在 C1/C2 之上,沉淀可复用技能,从经验中泛化并持续改进。

可以看出,三个能力层级并不是彼此割裂的:C2 以 C1 为前提,C3 又建立在 C1 与 C2 之上。一个能够长期成长的 H3 智能体,仍必须在每个具体任务中维持稳定推理和可靠记忆。



图 3 三类长程任务及其对应能力,任务跨度越大,能力要求越高

从 Prompt 到 Harness:

智能体控制面的三次跃迁

如图 4 ,本综述将大模型系统的演进概括为三个阶段。变化的关键不是 “提示词越来越长”,而是可被工程化控制的范围不断向外扩展。



图 4 长程智能体跨越三个阶段的演进概览

阶段一:Prompt Engineering(2020 - 2023)。通过指令、思维链、任务分解和自我修正等提示策略,引导模型在单次调用中产生更可靠的推理。控制主要集中在输入文本。

阶段二:Context Engineering(2023 - 2025)。系统开始主动组织检索结果、工具返回、对话历史与压缩摘要。重点从 “如何写一个好提示” 转向 “每一步究竟让模型看到什么上下文”。

阶段三:Runtime Harness(2025 至今)。控制面扩展到智能体运行脚手架:Harness 不仅组织上下文,还管理工具、记忆、工作流、权限、验证、恢复和多智能体协作。Agent 由一次模型调用,演化为可持续运行的智能体系统。

这一演进也解释了为什么当下的 Agent 竞争越来越像系统工程竞争:同一个基础模型,在不同 Harness 中可能呈现截然不同的任务上限、成本和可靠性。

六维图谱:

把碎片化智能体研究放进统一坐标系

本综述从 Foundation、Evolution、Harness、Optimization、Application 和 Frontier 六个视角下,如图 5 所示,论文将分散在记忆、工具学习、多智能体、强化学习、上下文工程、安全治理等方向的工作放入同一张图谱。其价值不仅是 “列出更多论文”,更在于回答每项改进究竟发生在哪里:是基础策略更强,还是 Harness 更完善;是提升单窗口推理,还是解决跨会话状态;是任务成功率更高,还是成本和安全边界得到改善。



图 5 长程智能体研究的统一分类框架:从演化、Harness、模型优化和应用,延伸至开放前沿

外部 Harness:

让长程能力可控制、可验证、可恢复

如图 6 所示,本综述把 Harness 拆为六个相互连接的核心组件,覆盖从目标设定到最终交付的完整生命周期:

  • 循环与工作流:包括线性执行、Plan—Execute 和分支搜索。它们负责显式分解任务、追踪子目标,并在失败时重规划或回退。
  • 上下文与记忆:对工作上下文执行丢弃、压缩和选择,将长期有效的信息写入持久记忆,避免上下文无限膨胀。
  • 工具、MCP 与技能:连接外部能力,支持工具接口与协议、主动工具发现以及可复用技能库。工具越多,选择、描述和安全治理也越重要。
  • 编排:完成任务分解、角色分配、协作拓扑和通信协议管理,使多个模型或智能体能够协同,而不是互相制造噪声。
  • Hooks 与中间件:在输入、工具调用和协议边界执行规则、权限、监控与安全策略,并可根据风险动态调整。
  • 验证:从步骤级到任务结束级检查正确性、安全性和目标一致性,并用外部信号驱动修正,而非依赖模型自我认可。

值得注意的是,Harness 并不只是 “给模型套一层壳”。它承担的是长期执行中的状态机、控制器和安全边界:当模型出现短视、遗忘或误判时,Harness 必须能让系统停下来、检查、切换路径或恢复。



图 6 Agent Harness 全景:六个核心组件贯穿从目标设定、规划执行到反思恢复、验证交付的完整生命周期。

内部优化:

把外化长程能力逐步写回模型内部

如果说 Harness 解决的是 “运行时怎样把事情做完”,内部模型优化解决的则是 “如何让策略本身越来越适合长程任务”。综述沿完整训练链路梳理了七类方向:

  • 架构底座:显式长上下文、压缩状态、混合架构与高吞吐机制,使长轨迹可表示、可训练、可负担地解码。
  • 任务、环境与轨迹合成:构建规模化、可验证、足够真实的交互环境,并生成包含成功与失败经验的长轨迹数据。
  • 预训练与中期训练:注入推理先验、长上下文状态、多模态感知和合理数据配比。
  • 微调:通过指令选择、课程学习与蒸馏,让模型先掌握基础交互,再逐步面对更长、更难的任务。
  • 智能体强化学习:处理长轨迹中的信用分配、策略优化、采样策略与多轮交互,使稀疏终局奖励能够指导中间步骤。
  • On-Policy Distillation:从模型自己生成、且不断变化的分布中学习,缩短教师策略与部署策略之间的偏差。
  • 自进化:从离线经验整理走向在线自我改进,进一步探索智能体与环境共同演化。

这条链路强调:训练数据不能只包含最终答案,还需要真实的环境反馈、过程状态、工具结果与错误恢复轨迹;优化目标也不能只看单步准确率,而要关注整条轨迹是否高效、可恢复且满足最终约束。



图 7 长程智能体能力的训练管线:以架构底座为基础,通过数据与环境合成、预训练、微调、强化学习、在线策略蒸馏和自进化,将运行时能力逐步内化进模型

长程智能体的形态:

以接口为线索的五类应用

如图 8 所示,论文按 Agent 与环境交互的接口,将实践形态归纳为五类。看似不同的应用,背后都承受目标漂移、状态持久化、反馈利用和验证恢复等共同压力:

  • 软件工程:理解大型代码仓库,维护跨文件计划,根据测试与评审反馈反复修复。
  • 信息检索:执行深度或广度搜索,整合多源证据,在长链检索保持结论可追溯。
  • 计算机操作:在浏览器、桌面和移动端持续感知界面状态,完成真实操作。
  • 多模态智能体:在图像、视频、音频等高成本信息中主动选择观察对象,并完成跨模态理解与生成。
  • 通用智能体:面向个人助理、具身系统和生产力任务,在多工具、多环境和长期目标之间切换。

相应地,评测也必须从一次性问答升级为 “面向时间跨度的评测”:任务是否真正包含长依赖?中间步骤能否检查?失败后是否恢复?系统在不同预算和 Harness 下的能力是否可归因?这些问题将直接决定榜单结果能否反映真实部署价值。



图 8 长程智能体的五类代表性应用形态

未来展望:

长程智能体的四个前沿方向

论文最终将开放问题归纳为四个轴、九个具体方向。随着任务跨度继续增长,研究重点将从 “能不能跑起来” 转向 “能否长期有效、经济并且可信地运行”。

  • Evolution:泛化与持续学习。让 Harness 自身能够演化、迁移和复用,并支持持续学习与终身学习。关键问题是:外置流程如何自动优化,又如何把经验稳定地内化为长期能力。
  • Effectiveness:进入真实环境。构建既可验证又足够真实的训练环境,提高昂贵真实交互的样本效率,并推动数字 Agent 向具身智能体迁移。论文认为,下一阶段的限速因素可能不再只是模型规模,而是环境构建。
  • Efficiency:学会花预算。未来 Agent 需要感知任务难度、剩余 token、时间和金钱预算,动态决定何时深思、何时压缩上下文、何时切换模型。多模态场景还要决定保留哪些帧、音频或视觉证据。
  • Trustworthiness:可恢复且可治理的自治。长轨迹会放大错误与权限风险,因此需要更早识别失败路径,以外部验证锚定反思,并通过最小权限、审批门、沙箱、来源追踪和独立审计保护安全不变量。

其中,一个重要判断是:生产环境中的安全与权限边界,主要落在 Harness,而非模型权重中。模型侧对齐必要但不充分;真正决定哪些工具可调用、哪些行动需审批、哪些经验可复用的,是运行时控制层。

总结:迈向长程智能体

过去的大模型 Scaling 围着参数、数据和算力而优化;进入智能体后,时间跨度成为另一条轴线:衡量的不是系统能跑多久,而是能否在更长、更复杂、更真实的依赖链上持续有效行动。这篇综述的核心判断很明确:长程智能体不是 “更聪明” 的单点升级,而是 Harness 工程与模型优化共同演化 的结果。从基础、演化、Harness、优化、应用到前沿,我们把分散研究收进同一张地图,也把开放问题落在演化、有效性、效率与可信性四条轴上。在梳理既有工作之外,我们还提炼若干将定义下一阶段长程智能体研究的新兴方向。希望本文能为后续研究奠定坚实基础,并为研究者与实践者提供有用参考。随着智能体系统不断成熟,长程智能体仍将是一个核心而开放的问题,并很可能在构建稳健、通用、持久的人工智能中发挥决定性作用。

作者信息:本文由中国人民大学、北京大学、清华大学、中山大学、香港科技大学和新加坡国立大学的研究者联合完成。论文的核心贡献者为董冠霆、宋晓帅、扈煜阳、金佳杰与张宬浩,通讯作者为中国人民大学高瓴人工智能学院窦志成教授。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
0比11,拒绝握手+拳打脚踢!14岁乒乓少年的体育精神,碎了一地

0比11,拒绝握手+拳打脚踢!14岁乒乓少年的体育精神,碎了一地

曹老师评球
2026-07-28 23:53:59
社保十年大倒查全面落地!花钱补缴、挂靠参保,这些人全都躲不掉

社保十年大倒查全面落地!花钱补缴、挂靠参保,这些人全都躲不掉

白米饭怎么吃
2026-07-27 08:35:20
“00后”上位,董事会全票通过,李慕牧成上市公司副总

“00后”上位,董事会全票通过,李慕牧成上市公司副总

红星新闻
2026-07-28 18:10:30
美国高管一家8口灭门案曝婚姻内幕!两名中国养女刚随妈妈回国寻根

美国高管一家8口灭门案曝婚姻内幕!两名中国养女刚随妈妈回国寻根

北美省钱快报
2026-07-29 01:39:36
难怪遗产一分不要,73岁迟重瑞现状曝光,原来他和coco是一类人

难怪遗产一分不要,73岁迟重瑞现状曝光,原来他和coco是一类人

冰语历史
2026-07-29 03:47:49
医院因一级甲等医疗事故致患者死亡 涉事医生“卡点考证”被质疑违规

医院因一级甲等医疗事故致患者死亡 涉事医生“卡点考证”被质疑违规

封面新闻
2026-07-28 17:58:30
炮制张氏叔侄十年冤狱,女神探聂海芬,民众为何强烈要求从严追责

炮制张氏叔侄十年冤狱,女神探聂海芬,民众为何强烈要求从严追责

原广工业
2026-07-18 11:06:26
中方打破多年外交惯例,王毅不出席中日韩外长会传递清晰态度

中方打破多年外交惯例,王毅不出席中日韩外长会传递清晰态度

阿器谈史
2026-07-28 15:41:53
爱弓凉 | “最强”G灯高挑熟女,魅力十足且风韵犹存的老A8

爱弓凉 | “最强”G灯高挑熟女,魅力十足且风韵犹存的老A8

吃瓜党二号头目
2026-07-25 10:10:42
武汉大学口腔医院:当事医生已停诊配合调查

武汉大学口腔医院:当事医生已停诊配合调查

南方都市报
2026-07-28 13:17:51
刚刚,西安交警发布通告:停运!

刚刚,西安交警发布通告:停运!

91.6陕西交通广播
2026-07-28 22:41:06
全球爆发粮食战争,各国停止向中国出口粮食,14亿人会挨饿吗?

全球爆发粮食战争,各国停止向中国出口粮食,14亿人会挨饿吗?

聪先生
2026-07-28 13:57:08
谢贤去世的前一天,前女友CoCo竟然说:谢贤就是她最值钱入场券

谢贤去世的前一天,前女友CoCo竟然说:谢贤就是她最值钱入场券

草莓解说体育
2026-07-29 01:03:58
难以置信!江苏一女子哭诉,我只是想跟一个老司机学习开网约车,他竟然想找我开房

难以置信!江苏一女子哭诉,我只是想跟一个老司机学习开网约车,他竟然想找我开房

火山詩话
2026-07-28 07:21:35
1949年,钱穆只问了一句话,便决定南下

1949年,钱穆只问了一句话,便决定南下

熊倌儿
2026-07-28 23:45:39
4-1!穆里尼奥回归皇马首场大胜 巴尔韦德破门 马斯坦托诺建功

4-1!穆里尼奥回归皇马首场大胜 巴尔韦德破门 马斯坦托诺建功

念洲
2026-07-29 06:41:22
菲等来外援,美航母驶入南海,10艘055齐出!携2000发导弹亮剑

菲等来外援,美航母驶入南海,10艘055齐出!携2000发导弹亮剑

董董历史烩
2026-07-28 06:34:33
全美直播暴跌65%,市值蒸发1.6亿 詹姆斯400万撕碎洛杉矶豪门底裤

全美直播暴跌65%,市值蒸发1.6亿 詹姆斯400万撕碎洛杉矶豪门底裤

冷桂零落
2026-07-28 13:25:02
关于王虹留学推荐信、保研等传闻,专访北大数院知情人士

关于王虹留学推荐信、保研等传闻,专访北大数院知情人士

新京报
2026-07-28 20:12:41
70万年薪逼宫!徐杰离队只为顶薪,宏远旧将扎堆野球,王洪泽暖心宠粉

70万年薪逼宫!徐杰离队只为顶薪,宏远旧将扎堆野球,王洪泽暖心宠粉

生活新鲜市
2026-07-29 04:01:14
2026-07-29 07:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13623文章数 142703关注度
往期回顾 全部

科技要闻

Kimi K3开放权重,想本地部署,200万元起

头条要闻

博主"听泉赏宝"炒股亏光父母积蓄遭拉黑 称"再玩剁手"

头条要闻

博主"听泉赏宝"炒股亏光父母积蓄遭拉黑 称"再玩剁手"

体育要闻

35岁德甲球星,退役半年后成了一名农民

娱乐要闻

43岁演员王凯去世!独居公寓无人知晓

财经要闻

潘老板的算盘全砸了,欠的25亿跑不了了

汽车要闻

宾利托卡尔重塑百年菱形美学,将于9月全球首秀

态度原创

艺术
房产
健康
教育
数码

艺术要闻

朱总理的硬笔字,潇洒儒雅,一股清劲!

房产要闻

拿下百亩宅地!又一河北民企,重仓海南!

中风急救吃安宫牛黄丸?千万别乱喂

教育要闻

鼓楼前200=栖霞前10?家长得知在一个班,心态崩了...

数码要闻

德商德静界推出带屏水冷新品,2.1寸圆屏可自定义

无障碍浏览 进入关怀版