网易首页 > 网易号 > 正文 申请入驻

NVIDIA SkillEvaluator:智能体技能性能评估基准发布

0
分享至


AI 智能体的实际效果,很大程度上取决于其所接收的上下文质量。即便底层模型能力强劲、NVIDIA 库文档完善,智能体仍可能在寻找正确工具时多走弯路,在无效方向上消耗大量 Token,或在专项任务中表现欠佳。技能包(Skills)将指令、示例和工具调用指引打包在一起,帮助智能体更快地从意图走向解决方案。为了衡量这些技能是否真正改善了智能体的执行路径和输出结果,NVIDIA 构建了一套面向智能体技能的开放评估体系。

NVIDIA SkillEvaluator 简介

NVIDIA SkillEvaluator 是一款开源工具,通过静态检查和带技能/不带技能两种条件下的实际任务运行,来量化技能对智能体性能的影响。NVIDIA 认证技能是经过打包和签名的能力描述符,能够精确告知智能体某个 NVIDIA 产品的功能、调用时机与调用方式。"认证"本身就是对技能就绪状态的一种度量。

本文分享了针对 30 余款 NVIDIA 产品、超过 300 项认证技能的首批基准测试结果。每项技能均在两套独立测试框架上完成评估,并通过比较安装技能前后的得分,计算出"技能提升值"(Skill Lift)。

目前,NVIDIA 已为 Claude Code、Codex 和 Cursor 发布对应插件,相同的技能也可通过 Skills.sh、ClawHub 和 Hermes Hub 获取。

三级评估体系

技能在发布前需经过三个层级的评估,每个层级回答不同的问题,且均可独立运行。

第一层:安全性与结构检查。执行静态检查,涵盖 Schema 与前置元数据验证、质量评分、提示注入与数据外泄安全扫描、敏感信息与个人隐私检测、许可证核查以及脚本代码检查。

第二层:差异性检验。通过嵌入相似度计算,识别单个技能内部的重复指导内容,以及技能目录中不同技能之间的覆盖重叠情况。

第三层:实时评估。在隔离沙盒中,分别在安装技能和未安装技能两种条件下,驱动智能体完成自动生成的任务,并量化两者的差异。

第三层评估基于 Harbor 框架运行。Harbor 是一个用于在可重复、隔离环境中执行智能体评估的开源框架,SkillEvaluator 负责处理 Harbor 的配置工作。它将评估用例转化为任务,在沙盒中运行智能体,收集结果,并计算技能的影响值。

所有结果均来自受控对比实验:针对每个评估用例,智能体测试框架分别在安装认证技能和不安装的条件下各运行一次,使用相同的提示词、模型、任务输入和评分标准,确保唯一变量为技能是否安装。这一对比在两套智能体测试框架中重复执行,两次得分之差即为该技能的贡献,以"Skill Lift"(单位:分)呈现。

快速上手

首先,为技能生成评估数据集:

skillevaluator create-eval-dataset ./my-skill --full

此命令将生成 evals/evals.json 文件,每个用例包含 ID、提示词和预期输出,以及可选的断言项。加上 --full 参数后,数据集将涵盖显式、隐式、上下文相关和负向用例。

完成用例审查后,执行实时对比评估:

skillevaluator tier3 evaluate ./my-skill \\ --agents codex \\ --env-mode docker

SkillEvaluator 会将用例转化为 Harbor 任务包,分别在安装技能和不安装技能两种条件下运行每个用例,对两次运行结果评分,并输出得分与 Skill Lift 值。整个流程对用户而言简洁清晰,底层执行与隔离管理均由 Harbor 负责。详细工作流程可参阅第三层实时评估文档。

基准测试结果

本节所有数据均来自 2026 年 8 月 12 日的 benchmarks.json 快照(提交记录 738d79e)。得分为各已发布技能与测试框架组合的宏平均值,赋予每个技能-框架对相同权重。Skill Lift 为安装技能后得分与未安装时得分之差,单位为分。由于目录持续评估更新,最新数据可在 nvidia/skills 仓库的 benchmarks.json 中实时查看。

在此次基准快照中,以下得分代表 NVIDIA/skills 仓库中各技能在未安装状态下,分别使用 Codex 和 Claude Code 两个框架完成相同任务时的平均表现。

评估维度共分五项。在"正确性"、"可发现性"、"有效性"和"效率"四个维度,基线平均分在 39 至 46 分之间(满分 100 分),说明存在较大的提升空间。"安全性"是例外,基线平均分高达 97 分,此维度的主要目的是验证安装技能不会引入安全回退。

已知局限性

正确性、有效性和安全性衡量的是运行结果,因此其基线反映了智能体在不安装技能时的原始能力。可发现性和效率同时衡量技能的使用过程,包括智能体是否找到技能、是否在行动前读取技能,以及是否避免了不必要的步骤。若未安装技能,这些动作本身就无从执行;但智能体仍可通过有效的工具使用、干净的执行过程,以及对不相关任务正确地不加载技能来获得得分,这也解释了为何上述基线约为 42 和 43 分而非零分。

大多数技能每个任务仅评估一次尝试,在已发布结果的技能中,85% 运行了一次,15% 运行了两次。由于智能体实时运行存在差异,单个技能得分会有所波动,目录级平均值汇总了数千次试验的结果,本文不报告置信区间。

技能安装后的性能提升

同一批评估使用了来自 NVIDIA/skills GitHub 仓库的技能。认证技能在两套测试框架上均提升了智能体性能,其中正确性、可发现性、有效性和效率的提升幅度最为显著。

在正确性和有效性这两个在两种条件下均可一致测量的维度,平均分分别从 46 分提升至 87 分、从 39 分提升至 78 分,提升幅度分别为 41 分和 39 分。这些得分并非通过概率估计,而是反映了智能体在评估专项任务上更高的平均表现。

可发现性和效率的 Skill Lift 分别为 40 分和 35 分。由于这两个维度的评分本身就以技能本身为参照对象,应将其解读为:一旦安装,智能体能够正确激活并使用对应认证技能的证据,而非对智能体无辅助行为的衡量。这一特性至关重要:智能体环境中的每项技能都在争夺智能体的注意力,一旦无关技能被错误加载,可能反而降低智能体的整体表现。

两套测试框架均呈现出一致且显著的性能增益。两者之间的差异在意料之中,这源于不同的默认系统提示、上下文处理方式和工具调用实现机制。认证技能提供的结构化上下文,是两套框架在无辅助条件下均无法自行产生的。

生态系统集成

OpenClaw 正在为 ClawHub 上的官方组织试点 SkillEvaluator。该集成运行第三层评估,并在"评估"标签页中展示安装技能前后的对比结果,方便开发者在发现和采纳技能的同时即可查阅评估信号。

Nous Research 在 Hermes Agent 中测试了 SkillEvaluator,并在技能安装流程中引入了 SkillSpector 的可选扫描功能。该集成对个人隐私、Unicode 注入、脚本代码规范、许可证和安全问题进行检查,并在安装前逐行呈现检测结果。整个工作流程由 29 个测试用例覆盖,每次技能扫描耗时约 1.4 至 1.5 秒。

三大实践发现

评估结果为构建和测试智能体技能的团队提供了三项实践性参考。

明确定义评估边界的重要性

明确界定核心任务、预期输出和超出范围的请求,能够在智能体实际运行前就产生更清晰的评估信号。技能的可测量精度,取决于其评估集对任务定义的清晰程度。

领域比测试框架的影响更大

不同产品之间的 Skill Lift 差异,远大于不同测试框架之间的差异。Claude Code 与 Codex 之间的平均差距约为 5 分,而各产品的 Skill Lift 从约 +2 分到 +46 分不等。领域特性、任务类型和评估设计,比使用哪套测试框架的影响更大。

Token 与执行效率的双向变化

SkillEvaluator 独立追踪 Token 使用量与效率指标。以单次尝试中的两个案例为例:jetson-optimize-memory 技能将 Token 用量从 617,306 个降至 142,540 个(降幅 76.9%),执行时间从 474.9 秒缩短至 220.0 秒(降幅 53.7%);相反,cuopt-install 技能将 Token 用量从 25,227 个增加至 55,582 个(增幅 120.3%),执行时间从 34.0 秒增加至 41.1 秒(增幅 20.8%),这一结果揭示了进一步优化的机会。SkillEvaluator 帮助识别某项技能究竟提升了 Token 和执行效率,还是需要进一步优化。

开始使用

如需上手,请访问 SkillEvaluator 文档,或在 GitHub 上浏览 NVIDIA 认证技能目录。

致谢

感谢 Roshni Malani、Meghana Puvvadi、Subodh Prabhu、Mohit Gupta、Yogesh Dangi、Yashraj Basaravaj Patil、Keshav Pradeep、Siddharth Itagi、Alejandro Sanabria Portala 和 Pranita Maske 对本项工作的贡献。

Q&A

Q1:NVIDIA SkillEvaluator 是什么工具,主要用来做什么?

A:NVIDIA SkillEvaluator 是一款开源评估工具,用于衡量"技能包"对 AI 智能体性能的实际影响。它通过在安装技能和不安装技能两种条件下分别运行任务,计算出"Skill Lift"(技能提升值),从而判断某项技能是否真正改善了智能体的执行效果。工具支持三层评估体系:静态安全检查、差异性检验和实时任务对比。

Q2:NVIDIA 认证技能的基准测试结果表现如何?

A:根据 2026 年 8 月 12 日的基准快照,针对 30 余款 NVIDIA 产品的 300 多项认证技能评估结果显示,安装技能后智能体在正确性维度平均分从 46 分升至 87 分(+41 分),有效性从 39 分升至 78 分(+39 分),可发现性和效率分别提升 40 分和 35 分。安全性基线已达 97 分,变化较小。两套测试框架(Codex 和 Claude Code)均呈现一致的显著提升。

Q3:SkillEvaluator 如何衡量技能对 Token 消耗的影响?

A:SkillEvaluator 独立追踪 Token 用量与执行时间。以实际案例为例,jetson-optimize-memory 技能使 Token 用量减少了 76.9%,执行时间缩短了 53.7%;而 cuopt-install 技能则使 Token 用量增加了 120.3%,执行时间增加了 20.8%。这说明技能对效率的影响因产品和任务不同而差异显著,SkillEvaluator 可帮助开发者识别哪些技能需要进一步优化。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
在中国,博士生的存量比驴的存量还多

在中国,博士生的存量比驴的存量还多

必记本
2026-08-24 02:31:42
羽毛球十年进化:技巧博弈变体能绞杀,世界级防守成标配

羽毛球十年进化:技巧博弈变体能绞杀,世界级防守成标配

体育硬核说
2026-08-24 01:06:36
老年人注意!身份证印着“长期有效”的老年人,出现这三种抓紧换

老年人注意!身份证印着“长期有效”的老年人,出现这三种抓紧换

麓谷隐士
2026-08-22 05:50:03
对家公司用200万年薪挖我,我上班第一个月只发3000块,我没吵没闹直接辞职,第二天,该公司股价蒸发了8个亿

对家公司用200万年薪挖我,我上班第一个月只发3000块,我没吵没闹直接辞职,第二天,该公司股价蒸发了8个亿

墨染尘香
2026-08-23 10:15:48
太敢说了!汤家凤教授怒批甲醛白菜,连发三问,句句直戳中痛点!

太敢说了!汤家凤教授怒批甲醛白菜,连发三问,句句直戳中痛点!

原来仙女不讲理
2026-08-24 11:47:36
16级!台风蛇皮走位?!预计登陆点公布

16级!台风蛇皮走位?!预计登陆点公布

大永强
2026-08-24 16:06:28
太炸裂啊!三个孩子生父成谜,韦先生的老婆庭审上发声,她坚持不认错,坚称她婚内无过错

太炸裂啊!三个孩子生父成谜,韦先生的老婆庭审上发声,她坚持不认错,坚称她婚内无过错

火山詩话
2026-08-18 14:55:32
李乃文紧急声明:王玉雯哭跟我没关系!网友:看出来了就是你

李乃文紧急声明:王玉雯哭跟我没关系!网友:看出来了就是你

韩小娱
2026-08-22 16:30:32
松岛辉空说,没有中国选手比赛就没有乐趣了

松岛辉空说,没有中国选手比赛就没有乐趣了

乒乓乐园
2026-08-24 13:21:19
终于有经济学家批评体制内退休金太高、加剧代际矛盾,评论区炸锅

终于有经济学家批评体制内退休金太高、加剧代际矛盾,评论区炸锅

慧翔百科
2026-06-23 08:47:02
三个座位的事,别急着站队:我问一个没人敢答的问题

三个座位的事,别急着站队:我问一个没人敢答的问题

社保小龙虾
2026-08-23 16:07:54
原来他是唐师曾儿子,跟随母亲生活,名字饱含深意,25岁事业有成

原来他是唐师曾儿子,跟随母亲生活,名字饱含深意,25岁事业有成

洲洲影视娱评
2026-08-24 14:28:29
整编十一师师长胡琏究竟有多能打?一个整编师就敢单挑整个中野

整编十一师师长胡琏究竟有多能打?一个整编师就敢单挑整个中野

墨策讲历史
2026-08-24 16:17:25
多地紧急排查“甲醛白菜”流向 专家提示买菜注意这几点

多地紧急排查“甲醛白菜”流向 专家提示买菜注意这几点

极目新闻
2026-08-24 10:53:36
27岁西安电子科技大学谭子航去世,妹妹透露原因,前后仅1个月

27岁西安电子科技大学谭子航去世,妹妹透露原因,前后仅1个月

180视角
2026-08-24 06:44:26
美国要变天了?一个比特朗普更难缠的80后,已经掌握了共和党

美国要变天了?一个比特朗普更难缠的80后,已经掌握了共和党

萧嚉影视解说
2026-04-14 16:52:43
大众新车官宣:8月28日,正式预售

大众新车官宣:8月28日,正式预售

科技堡垒
2026-08-23 11:25:03
94%对87%:靠我们吃饭,恨我们入骨,蒙古的拧巴藏不住了

94%对87%:靠我们吃饭,恨我们入骨,蒙古的拧巴藏不住了

小虎新车推荐员
2026-08-25 03:36:28
杰西卡·阿尔巴用49美元皮包把运动裤穿出高级感

杰西卡·阿尔巴用49美元皮包把运动裤穿出高级感

时光慢旅人
2026-08-24 00:17:17
武磊落选!国足亚运名单官宣,3超龄确定,1前锋+1中场+1后卫

武磊落选!国足亚运名单官宣,3超龄确定,1前锋+1中场+1后卫

惊鸿照影b
2026-08-24 11:18:22
2026-08-25 06:20:49
至顶科技 incentive-icons
至顶科技
科技产业媒体与 AI 产业服务机构
21200文章数 49729关注度
往期回顾 全部

科技要闻

宇树科技,3天跌了1000亿

头条要闻

美政府宣布对伊朗经济制裁措施 加大施压

头条要闻

美政府宣布对伊朗经济制裁措施 加大施压

体育要闻

42张照片 珍藏世界杯的热辣滚烫

娱乐要闻

韩沛颖开撕《主角》剧组引发全网热议

财经要闻

宇树IPO:追高、被套,多久能回血?

汽车要闻

可城可野可旅行 捷途旅行者 7 双车成都车展开启小订

态度原创

手机
时尚
旅游
健康
家居

手机要闻

折叠屏iPhone即将登场,苹果秋季新品发布会何时举办?

伊姐周日热推:电视剧《花开锦绣》;电视剧《师兄太稳健》......

旅游要闻

不靠古镇不靠洱海,大理小众村落,凭一片古树林惊艳世人!

孩子有脊柱侧弯,还能正常运动吗?

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版