来源:市场资讯
(来源:机器学习算法那些事)
当我们把一个复杂任务交给 AI 智能体,期待的是它能够理解目标、调用工具、处理反馈,并最终交付结果。
但随着任务推进,智能体需要面对的信息也在不断增加:最初的需求、执行计划、搜索结果、工具输出、报错日志、修改记录,以及一轮又一轮验证。每一项都曾经有用,却未必都需要完整地出现在下一次决策中。
哪些信息必须保留?
哪些过程已经可以压缩?
遗漏了关键证据,如何重新找回?
怎样判断任务已经完成?
这些问题,直接关系到智能体能否持续、可靠、经济地执行长任务。
围绕这一方向,TierFlow 研究团队完成了六项相互关联的研究,并将相关机制、方法与实验系统组织为专著——《智能体的记忆与遗忘:长时程任务中的状态、证据与高效执行》。
![]()
本书由王铭轩、罗飞、马彦彪、韩军功共同署名,分为三编六章,共 261 页,现已在 TierFlow 官网(tierflow.cn)研究页上线。
记忆的问题:什么该留,什么该忘
THE MEMORY PROBLEM
以代码修复为例,一段报错日志在定位问题时可能至关重要。当根因已经确认、修改已经落实、测试已经给出反馈,原始排查过程的保留价值就可能发生变化。与此同时,最初需求中一条不起眼的接口约束,仍可能决定最终交付是否正确。
因此,记忆管理需要结合任务状态来判断信息价值。仅按时间删除旧记录,或按照固定长度触发摘要,都可能错过真正的压缩机会,也可能提前丢掉仍然必要的信息。
本书的六项研究,沿着这一问题逐步展开。
02
PART
六项研究,一条主线
SIX STUDIES · ONE THREAD
研究
它回答的问题
交互感知压缩(ICLR)
历史推理何时可以被替代
PaMER / PaMER+
行动前状态能否预测压缩与召回需求
StateComp
压缩时机如何随任务进展调整
GEM
表征相近的内容为何证据作用不同
DRSR
多段历史共同删除的风险如何评估
OWG
执行状态如何围绕任务结果组织
首先:历史推理的可替代性与记忆需求表征
交互感知压缩(ICLR) 研究历史推理与后续行动之间的关系。当相关结论已经可靠地体现在代码、文件、工具输出或环境反馈中时,原始推理更有可能被替代。这项研究还考察了压缩如何改变后续执行路径:一次局部删除,可能影响后面的工具调用、重复探索和总计算量。
与之相衔接,行动前记忆控制研究考察模型准备采取下一步行动时的内部状态,分析其中能否预测压缩与召回需求,并据此提出 PaMER 与 PaMER+,将状态引导的压缩与历史证据检索结合起来。近期上下文承载当前工作状态,外部记忆则在需要时补充较早的证据。
接下来:“何时压缩”与“保留什么”的决策化
StateComp 根据当前智能体状态,判断哪些历史交互仍需完整保留,哪些已经具备被摘要替换的条件。它将压缩时机作为可学习的对象,使历史处理能够随任务进展调整。
GEM 则关注另一个容易被忽略的细节:两段内容即使在表征上十分相近,也可能承担不同的证据作用。两份测试输出的大部分文字可以相同,其中一行差异却可能决定下一步该修改哪个模块。基于这一观察,GEM 优先保护任务与执行证据,再利用几何信息补足历史覆盖。
进一步:联合删除风险与执行状态组织
DRSR 将候选删除集合放在一起评估。假设两段记录分别保存了同一条重要约束,单独删除其中任意一段可能影响很小,同时删除却可能让约束彻底消失。集合级风险建模正是为了处理这类信息依赖;当候选不满足风险条件时,系统可以放弃剪枝。
OWG 则以“结果—见证图”组织执行状态,将目标结果、支持证据、行动、产物与验证关系联系起来。它关注下一步决策实际需要什么:当前还缺什么证据,哪个产物需要修改,哪些结果已经验证,以及什么条件下可以结束任务。原始轨迹保存在外部,并在必要时恢复相关证据。
从推理的可替代性,到压缩与召回需求,再到压缩时机、证据保留、联合删除风险和执行状态组织,这六项研究共同构成了本书的技术主线。每项方法都有明确的操作对象、评估设置与适用条件。
03
PART
把方法放回完整任务
EVALUATION ON FULL TASKS
研究能力也需要通过具体实验来呈现。书中既分析机制,也将方法放回完整任务中,考察任务质量与资源消耗如何共同变化。
例如,在 StateComp 章节报告的 WorkBuddyBench 全部 260 项任务评估中,使用 DeepSeek-V4-Flash 作为执行模型,智能体与摘要的输入、输出合计 token 从约 6.98 亿降至 3.33 亿,减少 52.27%;平均任务奖励由 0.6987 变为 0.7026。在这一设置下,压缩大幅减少了上下文处理量,总体任务质量与未压缩执行保持接近。
在 DRSR 章节报告的 WorkBuddyBench Full260 评估中,平均任务奖励从 0.699 提升至 0.802,模型输入与输出合计 token 减少 20.82%。这一结果支持了从联合删除风险出发设计压缩策略的研究方向。完整基线、任务划分和统计口径均在对应章节及附录中给出。
评估设置
输入输出合计 token
平均任务奖励
StateComp · WorkBuddyBench 260 项
6.98 亿 → 3.33 亿(-52.27%)
0.6987 → 0.7026
DRSR · WorkBuddyBench Full260
减少 20.82%
0.699 → 0.802
这些数字之外,我们也关注结果为什么发生。行动前状态的探测、历史信息的受控替换、关键模块的消融,以及完整执行轨迹的分析,分别帮助我们检查信号来源、证据依赖和方法中真正起作用的环节。书中也讨论了分领域表现、恢复机制和方法边界,让读者能够理解结果成立的条件。
FINAL THOUGHTS
本书希望呈现的研究方式
围绕一个明确问题,提出可检验的假设,构建方法,并在完整任务中验证
这类研究与智能体产品面对的问题紧密相关。模型反复处理的内容规模会影响执行成本,关键约束和证据是否可用会影响任务可靠性,而对结果的验证则关系到最终交付质量。记忆管理连接着这些环节,也为改进智能体的长时程执行提供了具体切入点。
研究人员
获得可以继续追问的问题
工程开发者
获得可分析、可评估的方法
关注 TierFlow 的读者
更深入地了解清枢团队的技术思考与研究积累
欢迎前往 TierFlow 官网研究页tierflow.cn/research,阅读《智能体的记忆与遗忘》,了解六项研究的完整方法、实验与执行案例。也欢迎与我们交流智能体记忆、上下文管理和长任务执行中的实际问题。
《智能体的记忆与遗忘》
长时程任务中的状态、证据与高效执行
王铭轩 · 罗飞 · 马彦彪 · 韩军功 著
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.