Salesforce 的一项新研究揭示了自我改进智能体的一个关键短板:记忆的脆弱性。测试发现,任务执行顺序对智能体表现有显著影响,而这一影响远超预期。
研究对比了两种基于记忆的智能体方法。按 WebArena 默认顺序执行任务时,ReasoningBank 方法的性能提升了 1.5 分;但一旦打乱任务顺序,性能不升反降,下跌了 4.5 分。这一正一反之间,差距达到 6 分。
![]()
错误经验被“保存”下来
问题出在智能体对错误经验的记忆上。研究观察到,智能体会把失败的操作模式保存为“经验”。例如,在一个无法调用 API 的环境中,它仍会推荐调用 API 的解决方案——这种错误记忆在后续任务中被反复调用,拖累了整体表现。
改进反馈只能部分挽回
更值得关注的是稳定性。研究显示,在 71% 的案例中,打乱顺序后的结果比默认顺序更不稳定。即便研究人员改进了任务细节和环境反馈机制,也只能恢复约 31% 的性能下降。这意味着,单纯优化反馈信号,并不能完全弥补记忆顺序带来的干扰。
这项研究提醒我们:智能体的“经验”并非总是资产,错误的记忆固化反而可能成为性能的隐形杀手。如何让智能体学会遗忘,或许和学会记忆同样重要。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.