技能库不是越满越好
Google新发布的WikiSkill论文,把很多做Agent和个人知识库的思路直接掀了桌子。核心结论很刺耳:你以为越记越多是在进步,其实把执行记录、复盘认知和操作手册混在一坨,根本不可能产生复利。
![]()
论文给出的判断是,好手册能让9B小模型直接干翻27B裸跑,但弱者写的一身笨补丁,能把顶级大模型活活毒死。这个反差本身就是整篇论文最值得收藏的地方。
三层物理隔离才是复利基础
Google团队在WikiSkill里给出的第一组真相是:战术可以失败回滚,但对失败的理解必须永久焊死。真正厉害的系统必须物理拆成三层。
- 原始轨迹只读归档
- 复盘认知只增不减
- 执行手册随时修补回滚
论文指出,前人把探索教训散落在对话框里,每次遇到问题都像失忆一样重新踩坑。打法验证变差可以撤回,但踩坑认知必须留下,复利才会真正爆发。
程序性知识差距超过裸智力差距
第二组数据更直接:9B模型配上进化出的结构化手册,表现直接干翻27B裸跑。而在复杂表格任务上,27B模型加上手册更是直接从40%狂飙到81%。
论文由此判断,程序性知识的差距,早就超越了单纯堆参数的裸智力差距。也就是说,手册质量本身正在成为比模型规模更关键的分水岭。
低水平避坑套路会毒死高手
第三组真相指向一个反直觉现象:弱者的妥协是强者的毒药。小模型为了防止自己翻车写的一堆单行脚本和保守补丁,直接把顶级Gemini Flash从50%砸到了18%。
论文的意思很清楚,你在低水平阶段摸索出的避坑套路,强行套给高手往往是一副要命的枷锁。技能库如果只沉淀“别这么做”,反而会限制更强模型的发挥空间。
开卷小抄练不出真本事
第四组实验结论同样残酷:模型在实战练习时如果直接偷看全套知识库,最后进化出来的手册反而大退步。因为靠小抄蒙混过关的过程,会把最致命的逻辑漏洞给彻底掩盖掉。
这等于说,技能库的进化不能走捷径。练习阶段的“开卷”会让模型失去暴露错误的机会,最终沉淀下来的手册反而更不可靠。
把失败变成资产
论文最后的提醒是:别再把所有笔记和日志混在一堆乱炖了。原始记录、提炼认知、可执行手册是三码事。只有把失败变成资产,学习的飞轮才会真正转起来。
对于正在给Agent建技能库的人来说,这篇论文的价值不在于给出一个现成工具,而在于把“什么不该混在一起”这件事讲得足够清楚。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.