微软一篇论文把大模型智能体的长程表现拉出来量了一遍。研究跨了9个模型,结论很直接:依赖的步骤越多,成功率越低。
短程近乎满分,长程直接崩
![]()
在ToolQA基准上,短程任务里模型表现接近满分。但任务拉到16步时,成功率只剩0%到33%。这不是某一个模型的问题,9个模型都出现了同样的衰减曲线。
缩短上下文反而更糟
实验里还试了缩短上下文,结果衰减没有缓解,反而更严重。论文据此判断,问题主要由步数驱动,而不是上下文长度。步骤一多,错误就开始累积。
作者给了三个建议
- 按真实工作流的长度来测试,别只看短程分数。
- 度量每一步的可靠性,而不是只看最终结果。
- 在错误扩散之前加入检查点,把长任务切成可校验的段落。
这篇论文的价值在于把“智能体做长任务会变差”这件事,从体感变成了可复现的数字。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.