给智能体喂同样的历史轨迹,只是换一种打包方式,任务成功率就差了6.06个百分点。这不是模型升级,也不是数据量增加,纯粹是经验呈现形式的改变。研究人员把同一批过往执行记录分别做成两种形态:保留更多执行细节的Workflow Memory,以及经过蒸馏提炼的SKILL.md文件。结果后者明显胜出。
同样的经验,不同的包装
![]()
这项对比实验的核心变量只有一个——经验的封装方式。Workflow Memory保留了执行过程中的大量细节,步骤、中间状态、工具调用记录都在里面。SKILL.md则把这些杂乱轨迹蒸馏成一份干净的操作流程,告诉智能体先做什么、用哪个工具、检查什么、避开哪些坑。两组智能体接触到的底层经验完全相同,区别只在于拿到的是原始记录还是提炼后的流程。
结果显示,使用SKILL.md的智能体比使用Workflow Memory的智能体表现高出6.06个百分点。这个差距的意义在于,智能体并没有获得更多经验,它获得的是同一批经验被更好地组织后的版本。信息总量没变,信息结构变了,效果就上来了。
65.7%的案例靠流程锚定起作用
轨迹分析进一步揭示了技能文件为什么有效。在技能发挥作用的案例中,65.7%是通过“流程锚定”实现的——也就是明确该先做什么、该调用哪个工具、该验证什么结果、该避免哪些错误。只有4.5%的案例是因为技能文件补充了原本缺失的知识。这意味着技能的价值主要不在“教新东西”,而在“把执行顺序和检查点理清楚”。
这个机制解释了一个反直觉的现象:智能体不缺知识,缺的是在正确时机做正确动作的引导。技能文件把过往经验中反复出现的有效路径固化下来,让智能体不必每次从混乱的轨迹里重新摸索。它不是在扩充记忆库,而是在压缩决策空间。
技能用错场景反而会拖后腿
技能文件并非万能。研究同样指出了它的失效模式:当技能被用在错误的情境中,或者被过于死板地执行时,它反而会损害表现。一个为特定场景提炼的流程,换到条件不同的任务里,可能引导智能体做出不合适的动作。流程越清晰,偏离实际场景时造成的误导也可能越直接。
这说明技能文件的价值高度依赖使用场景的匹配度。蒸馏过程去掉了细节,保留了主干,但主干的适用边界需要智能体自己判断。如果判断失误,一份原本高效的流程就会变成束缚。
自我改进的方向不是更大的记忆库
这项研究给出的整体结论很明确:自我改进型智能体需要的是更好的经验蒸馏和应用机制,而不是单纯扩大记忆库。把更多原始轨迹堆进上下文,不如把已有经验提炼成可复用的操作流程。信息量不是瓶颈,信息的组织方式和调用时机才是。
对于正在构建智能体系统的团队来说,这条结论指向一个具体动作:把精力从收集更多执行记录,转向设计更好的经验提炼流程。一份干净的SKILL.md,可能比翻倍的轨迹数据更值钱。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.