网易首页 > 网易号 > 正文 申请入驻

一个Skill为什么越改越好?腾讯SkillHone让Agent记住每次优化决策

0
分享至



一个 Skill 这个星期能正常工作,不代表下星期也行。

搜索接口会被限流,API 会被改版,网页结构也可能突然变化。开发者发现了 bug,修好最近这个版本,再把文件交给下一轮 Agent。

最初为什么修改?试过的方案为什么失败?上一轮回退撤销了什么,又留下了什么?下一轮接手的 Agent 大多不知道。它拿到的只是结果,前几轮踩过的坑还得再来一遍。

腾讯微信在论文SkillHone中,将这个问题归结为优化历史丢失,进而提出了面向持续 Skill 进化的开发框架。

SkillHone 把每轮诊断、候选修改、评估证据和最终决定组织成持久决策历史。同时,持续优化的对象也从单一的 SKILL.md 文件扩展到了整个 Skill 文件夹及其修改过程。



视频链接:https://mp.weixin.qq.com/s/NkZcFC1Nv2i03JGJtNj3gQ

  • 论文标题:SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History
  • 论文链接:https://arxiv.org/abs/2606.08671
  • 代码链接:https://github.com/Tencent/SkillHone

一、不能只优化 Skills,

还要对 Skills 的优化过程本身建模

现有 Skill 方法大致分为两类。一类是 Skill-Creator,根据任务描述、示例或资料生成新的 Skill;另一类是 Hermes-SE(Hermes Agent Self-Evolution),通过不断修改已有 Skill 候选,并根据评估结果选择更优版本。

这类方法能够在单轮优化中得到更好的 Skill,但优化过程通常没有被保留。运行结束后,留下的往往只有最终版本文件。虽然文件差异可以展示「改了什么」,却无法回答「为什么这样改」。当环境发生变化时,Agent 也无法利用过去的优化经验,容易重复探索已经失败的方向。

SkillHone 不仅优化 Skill 本身,还对 Skill 的优化过程进行建模。每次优化步骤都会被记录为一条决策历史,包括问题诊断、候选修订、清洗后的评估证据以及最终结果。通过累积这些多轮决策记录,后续 Agent 可以理解某次修改针对的问题、采用的依据,以及最终保留或撤销的原因,从而将优化经验持续传递,而不仅仅是继承最终的 Skill。



视频链接:https://mp.weixin.qq.com/s/NkZcFC1Nv2i03JGJtNj3gQ

二、SkillHone 如何把优化过程留下来

SkillHone 设置了两个相互关联的仓库。Skill 仓库包括 SKILL.md、脚本、资料和模板;Skill-Eval 仓库包括练习探针、标准答案、验证器、运行轨迹和回归测试。



每轮进化开始时,评估侧先使用当前 Skill 运行验证集上的回归测试。优化侧根据脱敏报告和现存记录进行修改,评估侧再在基准版本上测试候选 Skill。系统决定接受、继续修改或拒绝修改后的 Skill,并将证据写回历史。

优化侧 Agent 可以修改 Skill,但是看不到未脱敏的答案。评估侧 Agent 可以运行验证、查看轨迹,但是不能写入 Skill 仓库。评估结果会被整理成失败类型、汇总分数和诊断线索,再返回给优化侧。

运行时调度器会根据需要生成诊断、开发、审核、执行和报告等子 Agent,每个角色都只获得完成自身任务所需的权限。它不要求使用固定的多智能体框架,只要求运行环境能够自动创建子智能体,因此可以直接接入 Claude Code、Codex 和 Hermes 等 Agent Runtime。

三、为什么要做 Repo 级别更新?



SkillHone 在优化过程中可以实现 Repo 级别的更新,而不仅仅只是优化SKILL.md

另一方面,SkillHone 还支持 Repo 级别的 Skills 更新。SkillOpt 和 Hermes-SE 都主要以 SKILL.md 为优化单元,本质上是在迭代 Skill 的自然语言描述,因此优化范围受限于单个文档。

相比之下,SkillHone 将优化对象扩展为完整的 Skill repo,将 Skill 视为由 SKILL.md、执行脚本、参考资料、模板等共同组成的完整 Repo。优化过程中,不仅可以修改指令描述,也可以直接更新脚本逻辑等辅助文件的内容。

四、五轮优化里,

SkillHone 如何处理回退?

系统只看最终分数时,一旦候选版本出现退化,整份候选往往会被丢弃。可是,候选版本中已经有效的改动也会随之消失,下一轮又得重新编写。

论文中写道,作者对深度研究 Skill 进行了五轮优化。系统加入 DuckDuckGo 回退和错误处理以后,探针准确率从 30% 提高到 60%。下一轮加入尽早作答和严格预算限制后,准确率又降低了 10 个百分点。



SkillHone 与 Hermes-SE 的五轮验证集上的优化轨迹(论文 Figure 4)

SkillHone 可以通过此前的历史记录分析出,问题出在预算策略上,因此只撤销有问题的部分,保留已经证明有效的搜索改进,第三轮准确率升至 65%。后来加入 SPARQL、名称规则和更严格的预算后,系统又进行了一次有针对性的撤销,准确率最终达到 70%。

同样从 30% 起步,Hermes-SE 根据标量分数接受或放弃完整候选,五轮后停在 40%。两条轨迹的差异很明显:SkillHone 可以查到是哪一次决定带来了性能退化,回退时还能保留已经有效的改动。

五、实验:性能、迁移与消融

作者在 GAIA 和 WebWalkerQA-EN 两个深度研究基准上测试了 SkillHone。评测在开放网络环境下进行,没有预先集成好的搜索工具。Agent 只能访问公共网页,再依靠 Skill 组织搜索、抽取、验证和失败后的恢复。

使用 Qwen3.6-35B-A3B 作为执行模型时,SkillHone 在 GAIA 上达到 64.6%,在 WebWalkerQA-EN 上达到 66.4%。相比使用商业检索服务的 deep-research Agent,两个结果分别高出 15.8 和 3.2 个百分点;相比 Hermes-SE,分别高出 14.2 和 13.4 个百分点。



表 1 SkillHone 在 GAIA 和 WebWalkerQA-EN 上的主结果

更重要的是,同一个 Skill 包在没有重新优化的情况下,直接迁移到 Claude Sonnet 4.6 后,GAIA 成绩继续升至 72.4%,仍高于 Hermes-SE、Existing-Skills 和 Skill-Creator。更换执行模型后,使用者不需要从头再做一遍优化。



图 2 不同方法在 Qwen 与 Claude Sonnet 4.6 上的 GAIA 结果

消融实验还提供了另一组证据。去掉决策历史以后,GAIA 和 WebWalkerQA-EN 的成绩分别下降 13.4 和 10.9 个百分点。去掉角色隔离以后,两项分数分别降低 6.4 和 5.3 个百分点。SkillHone 的两个组件都在发挥作用,其中决策历史至关重要。



表 2 决策历史与角色分离的消融实验

六、写在最后

总结一下整篇文章的脉络:

  1. 过去的自进化方法回答的是,怎么把技能文档改得更好;
  2. SkillHone 继续追问,这次为什么修改、凭什么接受、哪些想法已经不再采用;
  3. 优化过程因此可以被检索、复用,再交给下一轮 Agent 继续优化;
  4. Repo 级别更新让这套建模落到技能工程中,SKILL.md、脚本、参考资料和模板都可以被修改。

论文中的五轮轨迹给出了直接证据。SkillHone 遇到性能回退时,能够找到出现问题的修改并进行精准撤销,同时保留已经有效的改动。

下一轮 Agent 接手时,可以根据此前的诊断和证据继续决策,也可以直接修改 SKILL.md、脚本、参考资料和模板。SkillHone 通过持久化的决策历史,实现了整个技能仓库的持续进化。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美众议院通过决议要求停止对伊朗军事行动

美众议院通过决议要求停止对伊朗军事行动

国际在线
2026-07-23 23:40:06
国民党不抗日,南京不战而降?传播此类谣言良知何在?

国民党不抗日,南京不战而降?传播此类谣言良知何在?

涛哥锐评
2026-07-23 07:40:07
23岁中国籍男子在土耳其买甜品时遭持刀袭击被刺6刀,3名歹徒试图强抢手机和现金,案发后一人已被逮捕

23岁中国籍男子在土耳其买甜品时遭持刀袭击被刺6刀,3名歹徒试图强抢手机和现金,案发后一人已被逮捕

扬子晚报
2026-07-23 22:05:07
一条比缅北还要黑的产业链曝光

一条比缅北还要黑的产业链曝光

难得君
2026-07-23 16:26:26
谢家真正的传奇,是谢贤的母亲、谢霆锋的奶奶:半生扛风雨,一生懂清醒,默默撑起整个名门家族

谢家真正的传奇,是谢贤的母亲、谢霆锋的奶奶:半生扛风雨,一生懂清醒,默默撑起整个名门家族

市井大实话
2026-07-23 08:45:40
难以置信!上海一女生在徐汇区寻求陌生人免费借住过渡,声称是“纯绿色”

难以置信!上海一女生在徐汇区寻求陌生人免费借住过渡,声称是“纯绿色”

火山詩话
2026-07-24 06:42:41
乌军新司令获各方好评!俄罗斯国家电视台:最凶猛的“屠夫”

乌军新司令获各方好评!俄罗斯国家电视台:最凶猛的“屠夫”

鹰眼Defence
2026-07-23 21:00:47
意图破坏国际会议氛围,泄漏燃油危害周边生态,菲律宾上演侵闯黄岩岛海域闹剧

意图破坏国际会议氛围,泄漏燃油危害周边生态,菲律宾上演侵闯黄岩岛海域闹剧

环球网资讯
2026-07-24 07:00:20
菲尔兹奖得主邓煜谈“中美教育差异”和“是否回国发展”:不存在对所有人都适用的唯一答案

菲尔兹奖得主邓煜谈“中美教育差异”和“是否回国发展”:不存在对所有人都适用的唯一答案

极目新闻
2026-07-23 22:46:07
太狠了!伊朗真干了!

太狠了!伊朗真干了!

财经要参
2026-07-21 12:00:03
告别17年蓝白生涯!38岁铁卫宣布退出阿根廷队:139场8球3冠军

告别17年蓝白生涯!38岁铁卫宣布退出阿根廷队:139场8球3冠军

风过乡
2026-07-24 06:29:03
“瞧峰对瞄人缝”说:赵露思演唱会很有料!

“瞧峰对瞄人缝”说:赵露思演唱会很有料!

情感大头说说
2026-07-24 04:00:15
特朗普:美国在对抗伊朗方面进展很顺利,表现得极其出色,好得超乎任何人想象,伊无人机战损率达84%,导弹战损率高达91%,美军仅18人死亡

特朗普:美国在对抗伊朗方面进展很顺利,表现得极其出色,好得超乎任何人想象,伊无人机战损率达84%,导弹战损率高达91%,美军仅18人死亡

鲁中晨报
2026-07-24 11:40:03
“反华妖女”许可馨,回国后叫嚣无人敢动她,如今下场大快人心

“反华妖女”许可馨,回国后叫嚣无人敢动她,如今下场大快人心

眼底星碎
2026-07-24 08:55:05
21岁西班牙球星返乡,获赠140斤西红柿,被传拒绝了莱昂诺尔公主的芳心

21岁西班牙球星返乡,获赠140斤西红柿,被传拒绝了莱昂诺尔公主的芳心

译言
2026-07-23 09:17:00
打完菲律宾人才发现,中国海警手里拿的这是什么武器呀?

打完菲律宾人才发现,中国海警手里拿的这是什么武器呀?

阿龙聊军事
2026-07-23 10:55:06
全球哄抢百亿高铁大单,唯独不见中国身影,被坑过的中企懒得下场

全球哄抢百亿高铁大单,唯独不见中国身影,被坑过的中企懒得下场

小兰聊历史
2026-07-24 08:55:46
赛里木湖群殴事件:7名工作人员围殴游客,官方通报,新疆文旅天塌了

赛里木湖群殴事件:7名工作人员围殴游客,官方通报,新疆文旅天塌了

李晚书
2026-07-24 09:13:54
为什么邓煜与王虹获奖,而他们的合作者没有获奖呢?

为什么邓煜与王虹获奖,而他们的合作者没有获奖呢?

文忆天下
2026-07-24 10:15:56
三峡大坝收支出炉了:运行20余年,总投资近2500亿,如今回本了吗

三峡大坝收支出炉了:运行20余年,总投资近2500亿,如今回本了吗

阿讯说天下
2026-07-23 12:26:28
2026-07-24 14:56:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13590文章数 142698关注度
往期回顾 全部

科技要闻

中国等了90年,王虹邓煜同时摘下菲尔兹奖

头条要闻

获菲尔兹奖的邓煜:父亲是程序员 曾考虑成为围棋选手

头条要闻

获菲尔兹奖的邓煜:父亲是程序员 曾考虑成为围棋选手

体育要闻

小布泽:越看越不像他爸爸

娱乐要闻

陈妍希姐姐到场追星张凌赫

财经要闻

美国对数十个国家加征10%-12.5%的关税

汽车要闻

领克07GT正式上市14.58万起 把纯粹驾趣还给旅行

态度原创

本地
时尚
房产
公开课
军事航空

本地新闻

跟着影视去旅行:西游篇

今年夏天最时髦的穿法:衬衫+牛仔裤,太高级了!

房产要闻

狂抢111轮,溢价39%,楼面价刺破9500!海口土拍杀疯了!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普威胁对伊发动空前打击 伊朗、胡塞武装强势回应

无障碍浏览 进入关怀版