网易首页 > 网易号 > 正文 申请入驻

浙江大学等联合研究:AI智能体如何像老手工匠一样,越干越聪明?

0
分享至


这项由浙江大学、新加坡国立大学、上海交通大学与美团联合完成的研究,于2026年7月以预印本形式发布,论文编号为arXiv:2607.26784,感兴趣的读者可通过该编号查阅完整论文。研究团队提出了一个名为SkillRise的强化学习框架,核心目标是让AI智能体在完成一系列相关任务的过程中,不断积累可复用的"经验技巧",并将这些技巧带到下一个任务中去——就像一位经验丰富的手艺人,每做完一件活儿,都能把心得记在脑子里,下次遇到类似的活儿就能做得更顺手。

现有的AI智能体大多患有一种"健忘症"。每次开始一个新任务,它们都得从零开始摸索,完全不记得之前做过什么、踩过哪些坑。就好比一个学徒工,每天上班都会忘记昨天学的所有东西,永远停留在"初学者"阶段,这显然既低效又浪费。SkillRise就是为了解决这个问题而生的——它让AI智能体拥有了一本可以随时翻阅、不断更新的"工作手册",并且学会了如何把每次的经验提炼成真正有用的通用技巧,而不只是记住某一件具体事情的做法。

研究团队在三个经典的文字交互环境中验证了这一框架的效果。ALFWorld是一个模拟家居场景的环境,AI需要在虚拟房间里找到物品、放到指定地方,甚至加热或清洁东西。WebShop则是一个模拟网络购物的环境,AI需要根据自然语言描述的需求,搜索、筛选并购买合适的商品。ScienceWorld则更有趣,它是一个模拟小学科学实验的交互环境,AI需要完成各种科学探究任务。在这三个场景中,SkillRise的表现都超过了所有对比方法,优势幅度从2.3个百分点到8.5个百分点不等。

一、为什么"会总结经验"的AI比"努力干活"的AI更厉害

先来理解一下这个研究想解决的根本问题。传统的AI强化学习方法,通常是让AI反复尝试同一个任务,通过不断试错来改进自己的行为策略。这就像让一个孩子每天做同一道数学题,做上几千遍,他当然会做那道题了,但换一道类似的题,他可能还是不会。

另一种思路是给AI建一个"经验库",把之前遇到过的好方法存进去,下次遇到相似问题就去查一查。听起来不错,但这种方法有个麻烦:经验的提取、存储、检索、使用是四个不同的步骤,每一步都可能出问题,而且一旦最终结果不好,你很难判断到底是哪个环节出了差错,就像一道工序复杂的菜不好吃,你不知道是食材有问题、调料放错了,还是火候没掌握好。

SkillRise的解决思路则简洁得多。它不搞复杂的多阶段流水线,而是让同一个AI策略(可以理解为同一个"大脑")既负责完成任务,也负责在任务结束后总结经验、更新"工作手册"。这本手册的内容会直接传递给下一个任务时的AI,而不需要经过任何中间环节的检索或筛选。这就好比一个老工匠在每天收工后,亲自把当天的心得写进自己的笔记本,第二天上工时就把这本笔记放在手边翻阅——整个过程完全由他本人掌控,省去了中间人传话可能产生的误差。

二、SkillRise的工作方式:手艺人的三步修炼法

SkillRise的整体设计可以用一个手艺人学艺的故事来理解,而且这个故事贯穿整个系统的始终。

故事的第一步,是精心安排练习顺序。就像一个好的师傅不会让徒弟一上来就做最难的活儿,SkillRise会把同一类任务从简单到复杂排成一列。比如在WebShop购物场景中,同一个产品类别下,先安排只需要匹配一两个属性的简单购物任务,再安排需要同时满足颜色、尺寸、价格等多个条件的复杂任务。这样,前面简单任务中积累的经验,就能在后面复杂任务中发挥出更大的价值。每一批训练数据包含16个任务序列,每个序列由3个来自同一任务家族但具体内容不同的任务组成,并且对每个序列同时进行8次独立尝试,以便比较不同尝试之间的好坏。

故事的第二步,是干活与总结交替进行。当AI面对序列中的第一个任务时,它的"工作手册"还是空白的,只能凭本事硬干。任务结束之后,AI立刻切换身份,变成一个"总结者":它回顾刚才的整个交互过程,把有用的经验提炼成通用的步骤,把踩到的坑记录为"注意事项",然后把这些内容写进手册,交给处理下一个任务的自己。值得注意的是,切换身份的是同一套AI参数,只是使用的提示语(相当于"岗位职责描述")不同。此外,手册里绝对不允许出现"苹果1号放在抽屉3里"这种具体实例的记录,而必须提炼成"把目标物品放入指定容器"这样的通用规则。这个"去实例化"的要求非常关键,它确保了手册里的内容能跨任务通用,而不是成为某道题答案的小抄。

故事的第三步,是聪明地分配"功劳"与"反馈"。这里有一个微妙但重要的设计。AI干活时收到的好坏反馈(即这个任务有没有完成),用来训练它的"干活能力";而AI总结经验写手册时收到的反馈,则来自后续任务的完成情况。具体来说,如果AI在第一个任务后写了一份手册,这份手册的质量好不好,要等到第二个、第三个任务完成后才能知道,而且越近的后续任务反馈权重越大(通过一个折扣系数γ来调节,研究中设为0.6)。这就像一个老师傅评价自己指导徒弟的效果,不是看自己写的笔记有多漂亮,而是看徒弟拿着这本笔记之后,后续的工作做得好不好。这种设计让"总结技能"的训练信号与"干活技能"的训练信号彼此独立,不会相互干扰,从而让AI能同时把两件事都学好。

在计算每次尝试的"进步信号"(即强化学习中的优势值)时,SkillRise也很讲究:同样位于序列第一个任务、同样处于"干活"阶段的多次尝试,才会互相比较好坏;干活阶段和总结阶段的尝试,绝不混在一起比较。这就像体育比赛的赛制,跳高选手和跳远选手不会放在同一组排名,否则比较毫无意义。

三、手册长什么样:从具体案例看技能是如何沉淀的

研究团队在论文中展示了两个真实的训练案例,非常生动地展示了这本"工作手册"的更新过程。

第一个案例讲的是从失败中学习。AI面对的第一个任务是把两个喷雾瓶放进柜子,但它只放了一个就找不到另一个了,任务失败。任务结束后,AI总结道:如果需要放置多个同类物品,应该对每个物品重复整套"找到-拿起-移动-放入"的流程。这条通用规则被写进手册。下一个任务是把两个胡椒粉瓶放进柜子,任务涉及的是完全不同的物品,但手册里的规则同样适用,AI顺利完成了任务。一个来自失败的教训,在不同的具体场景中发挥了作用,这正是"可迁移技能"的价值所在。

第二个案例展示的是成功之后的技能迭代。第一个任务是把一部手机放到床上,目标位置(床)不需要打开,AI顺利完成,手册里记录了基本的"找到物品-拿起-移动到目的地-放下"流程。第二个任务是把一个番茄放进微波炉,AI发现微波炉的门是关着的,所以需要先开门再放东西。任务成功后,手册更新了:在第五步"把物品放到目标容器"之前,增加了一条新规则:"检查目标容器是否可以打开,如果是关闭状态,先开门"。这条新增规则使用的是"目标容器"这种通用表达,而不是"微波炉"这个具体词语,因此未来遇到柜子、冰箱、箱子等任何需要开门的容器时,同样适用。这种从具体经验提炼通用规则的能力,正是SkillRise着力培养的核心技能。

四、实验结果:数字背后的意义

研究团队在三个基准测试环境中,与多种方法进行了系统比较。对比的方法涵盖三类:零样本提示、ReAct(一种将推理和行动交替进行的经典方法)、Reflexion(一种让AI通过语言自我反思来改进的方法)属于不需要专门训练的提示类方法;PPO、RLOO、GRPO、GiGPO属于标准强化学习方法;LaMer则是一种元学习方法,它让AI对同一个任务反复尝试,并从每次尝试的反思中积累经验。

在ALFWorld的六种家居任务(拿取物品、查找物品、清洁物品、加热物品、冷却物品、拿取两件物品)上,SkillRise的总体成功率达到85.9%,而表现最好的基线方法GiGPO为83.6%,领先了2.3个百分点。在六个子任务中,SkillRise有五个排到了第一或第二名。在WebShop购物任务上,SkillRise的成功率为84.4%,而GiGPO为77.3%,领先幅度扩大到7.1个百分点。在ScienceWorld科学实验场景中,SkillRise达到54.6%,GiGPO为46.1%,领先了8.5个百分点。

论文还测试了"Pass@2"和"Pass@3"指标,也就是对同一个测试任务进行两次或三次尝试时,只要有一次成功就算通过。在这个设定下,AI会把上次尝试的手册带入下一次,相当于在同一个任务上使用技能迭代。SkillRise在这两个指标上同样领先所有方法,并且超越了专门为"同任务多次尝试"而设计的LaMer方法。在ScienceWorld的Pass@3上,SkillRise达到61.0%,而LaMer仅为46.8%,差距高达14.2个百分点。这说明SkillRise学到的"总结经验"能力,不仅能跨任务工作,也能在同一任务的反复尝试中发挥作用——尽管它压根就不是为这个目的专门训练的。

五、越干越聪明:序列越长,表现越好

这项研究中最有趣、也最有说服力的一个发现,是"跨任务测试时间扩展"现象。研究团队做了这样一个实验:把相同的128个测试任务,分别组织成长度为2、4、6的相关任务序列,每个任务只尝试一次,但AI可以在序列内积累手册。结果发现,SkillRise的Pass@1成功率从序列长度为2时的83.6%,稳步提升到序列长度为6时的87.5%,提升了3.9个百分点。

这个发现的关键之处在于:每个任务都只尝试一次,所以性能的提升绝对不是因为对同一题目多次抽样带来的运气成分,而是真真切切地因为之前任务积累的技能帮助了后面的任务。相比之下,LaMer、GiGPO、GRPO这三个对比方法在序列长度增加时,并没有表现出持续稳定的提升趋势。这正好印证了SkillRise学到的是真正可迁移的技能,而不仅仅是对某一具体任务的过拟合。当序列长度增加到6时,SkillRise与最强基线之间的差距从3.9个百分点扩大到8.6个百分点,优势随着"积累的任务经验越多"而越来越显著。

六、消融实验与效率对比:哪些设计真正有效

研究团队还做了一系列对照实验,来验证各个设计选择的必要性。

关于折扣系数γ的选择,研究团队测试了0.3、0.4、0.6、0.7四个取值,发现四种设置下的训练曲线几乎重合,最终性能相差不超过一个百分点。这说明SkillRise的设计对这个超参数非常不敏感,不需要精心调参才能奏效,具有很强的实用性。

关于"总结经验"这一步骤是否真的有必要,研究团队设计了一个"无总结变体":保持同样的K=3任务序列和同样的环境交互次数,但去掉任务间的手册更新步骤,阻止技能在任务间传递。实验结果显示,在训练初期三种方法差不多,但随着训练的推进,有手册总结的SkillRise开始拉开差距,最终比"无总结变体"高出约3个百分点,比普通的GRPO高出超过6个百分点。这证明了两件事:仅仅把任务排成序列是不够的,必须显式地把经验提炼成手册;跨任务的技能积累提供了超越单任务优化的额外学习信号。

在与其他"有外部技能管理流水线"的方法相比时,SkillRise的效率优势更为突出。RetroAgent是一种生成反思、存入记忆库、检索相关经验、更新效用分数的多步骤系统;SkillRL则需要借助强大的教师模型来提炼轨迹、分层构建技能库、冷启动监督微调、技能检索和迭代更新等多个阶段。在ALFWorld上,SkillRise的平均成功率与RetroAgent持平,均为85.9%,比SkillRL高出12.5个百分点。然而在运行时间上,RetroAgent需要SkillRise的6.0倍,SkillRL需要4.3倍。由此可见,复杂的外部管理流水线并不一定带来性能提升,反而会大幅增加计算开销,而SkillRise用更简洁的端到端设计,实现了同等甚至更好的效果。

七、从小到大都管用:不同模型规模下的表现

研究团队还测试了SkillRise在不同模型规模下的表现,以确认其优势不依赖于特定大小的模型。实验使用了Qwen3-1.7B(约17亿参数)和Qwen3-4B(约40亿参数)两个规模的语言模型,并与GRPO和LaMer进行比较。

在1.7B的较小模型上,SkillRise就已经达到78.1%,超过最强基线3.1个百分点。换到4B的较大模型后,SkillRise提升到85.9%,领先优势进一步扩大到6.2个百分点。更值得关注的是提升幅度:从1.7B到4B,GRPO提升了4.7个百分点,LaMer提升了3.3个百分点,而SkillRise提升了7.8个百分点。这意味着模型越大,SkillRise从中获益越多。研究团队的解释是,SkillRise需要AI同时学会"完成任务"和"从任务中抽象通用技能"两种能力,更大的模型在处理这种复合型学习任务时拥有更强的能力上限,因此提升空间也更大。

说到底,SkillRise想要解决的是一个非常基础但长期被忽视的问题:AI应该能从经验中学习,而且这种学习应该是可迁移的,而不是对某一具体场景的死记硬背。通过把相关任务组成序列、让AI在任务间维护一本不断更新的"技能手册"、并用后续任务的结果来评价手册的质量,这个研究提供了一种清晰、高效、可端到端训练的解决方案。

归根结底,这项研究告诉我们,让AI变得"越来越聪明"不一定需要无限增加模型的规模,也不一定需要搭建极其复杂的管理系统。有时候,给AI一本可以自己更新的工作手册,并且让它学会如何正确地总结经验、如何把具体的遭遇提炼成通用的智慧,才是更根本的进步方向。随着未来更大规模的模型和更复杂的现实任务场景被纳入测试,这种跨任务技能学习的范式是否能持续稳定地发挥作用,以及如何在没有"任务家族"标签的开放环境中自动识别相关任务,仍然是值得深入探索的方向。有兴趣深入了解技术细节的读者,可以通过论文编号arXiv:2607.26784查阅完整原文。

Q&A

Q1:SkillRise与传统强化学习方法有什么根本区别?

A:传统强化学习把每个任务当作独立的事件来处理,AI完成一个任务后不会把经验带到下一个任务,每次都从零开始。SkillRise则让AI在完成一个任务后,立即总结经验并更新一份"技能手册",这份手册会直接传递给处理下一个任务的AI,形成跨任务的经验积累。这种设计让AI在面对一系列相关任务时,表现会随着任务数量的增加而持续提升。

Q2:SkillRise的技能手册里会记录什么内容,又怎么保证不同任务都能用得上?

A:手册里记录的是提炼过的通用步骤和注意事项,而不是某次具体经历的原始记录。系统的设计要求AI在总结时必须把具体实例替换为通用概念——比如"苹果1号放在抽屉3里"要被改写成"把目标物品放入指定容器"。这种"去实例化"处理确保手册内容能够适用于不同具体对象,从而在新任务中同样有参考价值。

Q3:SkillRise的训练成本比其他技能学习方法高吗?

A:恰恰相反,SkillRise比其他有外部技能管理流水线的方法效率更高。实验数据显示,RetroAgent和SkillRL的运行时间分别是SkillRise的6倍和4.3倍,但它们的性能并没有相应的优势,SkillRL甚至比SkillRise低12.5个百分点。SkillRise不需要外部教师模型、独立的记忆存储模块或检索系统,用同一套AI参数完成任务执行和经验总结两件事,结构简洁,计算开销低。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
8 月 7 日郭晶晶 4 张照片炸上热搜,这次没人再夸她嫁得好!

8 月 7 日郭晶晶 4 张照片炸上热搜,这次没人再夸她嫁得好!

老吴教育课堂
2026-08-08 05:38:47
把警告当耳旁风!菲律宾行动升级开出第四枪,拖走菲舰刻不容缓

把警告当耳旁风!菲律宾行动升级开出第四枪,拖走菲舰刻不容缓

小蔑谈事
2026-08-08 08:55:41
中国女篮大胜尼日利亚,诞生三大不可思议,张子宇实锤第一中锋

中国女篮大胜尼日利亚,诞生三大不可思议,张子宇实锤第一中锋

宗介说体育
2026-08-08 11:03:09
丢人丢到国外了!49岁中国奥运冠军严重违规被查,官方:他已辞职

丢人丢到国外了!49岁中国奥运冠军严重违规被查,官方:他已辞职

二疯说球
2026-07-31 10:14:55
全国“第一学院”的背后:马院扩张的逻辑与隐忧

全国“第一学院”的背后:马院扩张的逻辑与隐忧

民间胡扯老哥
2026-08-06 07:18:02
账面繁荣,现实无感:4.5万亿协议,仅动用1100多亿元,太低了

账面繁荣,现实无感:4.5万亿协议,仅动用1100多亿元,太低了

南生今世说
2026-08-07 11:57:16
劝退笔试第一副校长撤职 老师降六级,另6人处分,第一名依旧落榜

劝退笔试第一副校长撤职 老师降六级,另6人处分,第一名依旧落榜

天天热点见闻
2026-08-08 21:12:38
FIFA主席因凡蒂诺的奢华生活与21%股份出售争议

FIFA主席因凡蒂诺的奢华生活与21%股份出售争议

慢享生活集
2026-08-08 01:53:38
英媒:因凡蒂诺在欧足联任职时,与女员工发生关系并由欧足联埋单

英媒:因凡蒂诺在欧足联任职时,与女员工发生关系并由欧足联埋单

懂球帝
2026-08-08 05:03:17
女排换帅声浪再起,球迷看好的下一个接棒者,反而不是郎平

女排换帅声浪再起,球迷看好的下一个接棒者,反而不是郎平

野渡舟山人
2026-08-09 01:37:49
中方亮剑黄岩岛不到48小时,美司令公开喊话,没有国家能主导印太

中方亮剑黄岩岛不到48小时,美司令公开喊话,没有国家能主导印太

好贤观史记
2026-08-09 02:12:11
刚说竹知了是日本玩具,他就被封了,乱带节奏有风险

刚说竹知了是日本玩具,他就被封了,乱带节奏有风险

历史总在押韵
2026-08-09 00:41:45
网传很多公司开始拒绝有考公经历的求职者,网友说:没考公考编照样找不到工作!

网传很多公司开始拒绝有考公经历的求职者,网友说:没考公考编照样找不到工作!

黯泉
2026-08-08 17:27:49
太意外了!2032奥运举办地敲定:结果惊呆众人,奥运格局大变!

太意外了!2032奥运举办地敲定:结果惊呆众人,奥运格局大变!

小涛叨叨
2026-04-22 17:06:20
WTT瑞典大满贯:女单签位公布!国乒首轮战伊藤美诚,王曼昱等人对手出炉

WTT瑞典大满贯:女单签位公布!国乒首轮战伊藤美诚,王曼昱等人对手出炉

全言作品
2026-08-08 22:54:19
第一波台风雨已经上岸,“白海豚”影响上海时间长→

第一波台风雨已经上岸,“白海豚”影响上海时间长→

上海预警发布
2026-08-08 10:56:22
染红仍取胜!澳大利亚35-32力克日本,新帅首秀开门红

染红仍取胜!澳大利亚35-32力克日本,新帅首秀开门红

林间小温柔
2026-08-08 22:23:38
首日打不过《八仙》,《龙餐馆》25亿无望,沈腾不败金身要破了?

首日打不过《八仙》,《龙餐馆》25亿无望,沈腾不败金身要破了?

靠谱电影君
2026-08-08 17:58:44
19岁日本天才杀疯了:3度落后3度扳平 决胜局4-8后轰7-0逆转进4强

19岁日本天才杀疯了:3度落后3度扳平 决胜局4-8后轰7-0逆转进4强

风过乡
2026-08-08 14:18:26
卧室内意外离世!29岁克拉克死亡报告公开,离世噩耗震惊灰熊全队

卧室内意外离世!29岁克拉克死亡报告公开,离世噩耗震惊灰熊全队

林雁飞
2026-08-08 13:38:20
2026-08-09 04:47:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9454文章数 568关注度
往期回顾 全部

科技要闻

SpaceX最快下周完成600亿美元收购Cursor

头条要闻

十多万人报名的考试成绩全作废 考生:为何让别人买单

头条要闻

十多万人报名的考试成绩全作废 考生:为何让别人买单

体育要闻

蓉城0-1玉昆 中超6轮不胜仍13分领跑 奥斯卡头球制胜+赛季16球

娱乐要闻

萧敬腾坦白!与大14岁妻子选择丁克

财经要闻

一枚“回旋镖”,击中王思聪

汽车要闻

华为乾崑+大六座 星海V6预售8.99万元起

态度原创

手机
艺术
本地
游戏
军事航空

手机要闻

vivo神秘新机现身Geekbench,天玑7500芯片

艺术要闻

她们在腿上开画展,尺度惊人却没人骂“低俗”,反而看呆百万网友:这身体,是行走的美术馆!

本地新闻

课本里的童年,绍兴正上演

被发行商逼入绝境后,他们把预算300亿韩元的抽卡二游魔改成了单机,居然在Steam上火了?

军事要闻

伊朗公布“被击落的美以战机残骸”

无障碍浏览 进入关怀版