为什么AI代理明明拥有完整的上下文,却还是会基于过时信息做出错误决策?本文展示了一个确定性基准,证明在执行前跟踪事实有效性,可以消除多步代理任务中的浪费工作。
上下文完整不等于信息有效
![]()
作者指出AI代理的一种失效模式:上下文窗口可能保存完整但已过时的信息,导致代理基于过时事实行动。文章以航班价格为例说明:一个事实在加载时可能正确,但几分钟后就会变为错误;若没有有效性检查,代理仍会继续执行注定失败的计划。
作者用一句关键引语概括了这个问题:「上下文窗口可以记住过去的一切,却给代理呈现错误的现在。」这不是上下文丢失,而是上下文在失效后仍然残留很久。
两种执行器的对比实验
为衡量此问题,作者用纯Python构建了一个确定性基准,包含两种执行器:
- 基线执行器:仅在动作失败时发现破损依赖
- 有效性感知执行器:在行动前检查依赖状态
实验结果表明,具备有效性检查的执行器消除了预先失败的工作,实现了零步失败;而基线执行器在无效计划上浪费了步骤。这证明主动验证可以防止计算浪费。
图的大小才是关键变量
作者最初假设依赖图的拓扑结构是影响浪费工作的主要因素,但96种配置的扫描驳斥了这一点。最终结论是:图的大小而非形状,是预先失败工作的主要驱动因素——更大的依赖图会产生更多浪费工作。
文章还区分了事实性失效与操作性失效。作者用另一句引语点明核心:「转录告诉代理过去的情况;有效性层则告诉代理这些信息现在是否仍然安全可用。」真理与可用性是两回事。
有效性跟踪并非免费午餐
文章建议在多步计划中使用有效性检查,尤其是当动作成本高或会话长时。但在以下场景中可以省略:
- 单次查询
- 低成本重试
- 事实不变的静态任务
作者强调,消除失败工作本身就是机制运作的内在特性,但有效性跟踪需要付出开销,应有选择地使用。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.