谷歌发了一篇新论文,讲的是怎么让大模型智能体在长任务里不跑偏。结论有点反直觉:关键不在于模型多聪明,而在于把工作流从聊天记录里搬出来,画成一张可以改的图。
问题出在任务变长之后。智能体跑着跑着就忘了自己走到哪一步,同一个工具反复调用,或者把步骤顺序搞反。聊天历史越堆越长,模型反而越容易迷路。
![]()
给智能体一张"下一步能做什么"的地图
论文提出的做法叫程序图(Procedural Graphs)。它给智能体一张小地图,标出接下来可能发生什么,同时不限制模型自由推理的空间。地图不是死规则,模型仍然可以自己判断怎么走。
每次任务跑完,另一个大模型会对比成功和失败的案例,然后动手改这张图。改完不是直接生效——只有确认不会拖累留出任务的表现,这次修改才会被保留。这套机制让流程图能随着执行不断自我进化。
效果数据摆在这里:在24组模型与基准测试的组合中,这个方法拿下第一或并列第一的有21组。
它还顺手修好了一张人画的烂图
更有意思的是修复能力。在 MultiChallenge 基准上,原本有一张人工设计的工作流图,本身存在缺陷,成功率只有 58.93%。经过这套方法精炼之后,成功率涨到了 92.86%。
也就是说,它不只是从零搭流程,还能识别出人类设计的流程哪里有问题,然后改对。
代价是有的。这种引导会消耗额外的 token,所以它最适合的场景是:长流程本身就是瓶颈的时候。短任务上用它,多花的成本未必划算。
论文给出的整体建议很直接:把关键流程从聊天历史里挪出来,放进一个显式的、可编辑的、能从执行中自我改进的工作流里。论文标题是《Procedural Graphs: Self-Evolving Execution Structures for LLM Agents》,挂在 arXiv 上,编号 2609.09153。
对做智能体的人来说,这个方向的启发在于:与其不断往上下文里塞更多历史,不如给模型一张能改的地图。历史是流水账,地图才是导航。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.