![]()
这项由普林斯顿大学、卡内基梅隆大学、多伦多大学、伊利诺伊大学厄巴纳-香槟分校、斯坦福大学及牛津大学的研究人员联合开展的研究,以预印本形式于2026年8月5日发布,论文编号为arXiv:2608.05139v1,分类于计算机科学·计算与语言方向。有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。
你有没有遇到过这样的人:他们数学很好、写作也不错、逻辑推理能力也挺强,但是一旦要在同一道题里同时用上这三种能力,就会突然显得有些手忙脚乱?现在的大型语言模型(也就是我们常说的AI助手,比如各种聊天机器人)也有完全相同的问题。它们可以把每一门"功课"单独做得很漂亮,但一旦需要在同一段推理过程中连续切换不同类型的思考技能,准确率就会明显下滑。
这批来自多所顶尖高校的研究人员决定把这个问题彻底研究清楚。他们做了两件事:第一,造了一把尺子,专门用来衡量"切换技能"到底有多难;第二,用这把尺子来训练AI,让它学会更流畅地切换。这把尺子有个名字,叫做"技能熵"(Skill Entropy),而他们基于这把尺子构建的评测体系叫做Skill?-Bench,配套的训练方法叫做Skill-Entropy RL。整套研究形成了一个从诊断问题到解决问题的完整闭环。
一、为什么AI的"切换脑子"这么难?
考虑这样一个场景:你是一名旅行规划顾问,客户给了你一段导游词,里面藏着一道速度时间距离的数学题,解完这道题之后,你要根据答案安排行程时间表,然后再从一堆旅游攻略文本里找出某个景点的门票价格,最后把整个行程用一封漂亮的邮件写给客户。这整个过程需要你先做数学计算,然后做规划安排,然后做信息提取,最后做创意写作——四种完全不同的思维模式在短短几步之内全部登场。
对人类来说,这种切换是自然而然的,因为我们习惯了在不同情境下切换"模式"。但对AI而言,每种技能都有其独特的"答题风格":数学题喜欢给出简短的数字答案,创意写作需要长篇的叙述性段落,逻辑推理要求一步一步的演绎格式。当AI刚刚完成了一道数学题,脑子里还充满着数字和公式的时候,下一步突然要写一段故事性文字——它往往会"惯性滑行",把数学题的答题风格带进下一步,交出一个简短的数字答案,而不是你期待的那段叙述。
研究团队把这种现象称为"技能切换失败",并通过大量实验证实了它的普遍存在。他们发现,即便是目前最强的商业AI系统,当一道题需要的技能切换难度越来越高时,准确率也会单调下降。更令人意外的是,当同一个技能被放在一个需要切换的多步任务里评测时,相比单独评测这个技能,准确率会下降4%到13%不等。换句话说,AI并非"不会"某个技能,而是在需要切换的语境下,那个原本会的技能也变得不好使了。
二、什么是"技能熵"?一把衡量"切换难度"的专属尺子
研究团队需要一种方法,能够定量地说清楚"从技能A切换到技能B,到底有多难"。他们创造的这个量叫做"技能熵"。
技能熵的核心逻辑并不复杂。研究人员选定一个参考AI模型(他们使用了Claude-opus-4.7),先测量它单独做技能A的准确率,再单独测量它做技能B的准确率,然后测量它在一道先用A再用B的两步题里的整体准确率。如果先做A再做B的表现和单独做A、单独做B差不多,说明这两者之间切换容易,技能熵接近1。如果先做A再做B的表现明显比两者单独表现都差,说明这个切换本身带来了额外的困难,技能熵就会大于1,数值越高,切换越难。
这里有一个细节值得关注:技能熵是有方向的。从A切换到B,和从B切换到A,难度并不一定相同,就像从中文翻译成日语和从日语翻译成中文的难度通常不一样。所以技能熵(A到B)和技能熵(B到A)是分开计算的两个数字。
计算整道多步题的难度时,研究团队把题目中每一次相邻技能切换的技能熵加起来求平均,得到一个"任务级技能熵"分数,代表这整道题在切换层面的总体难度。分数低意味着切换容易,分数高意味着切换困难。
在技术实现层面,由于整个技能库包含558个技能,如果两两配对直接测量,需要约31万次评测,完全不现实。研究团队因此设计了一种近似算法:把技能之间的切换分解为"先从某技能切换到某领域"和"再从某领域切换到某技能"两个步骤的乘积,把计算量从约31万次压缩到约5000次,精度损失极小。
研究团队通过大量实验验证了技能熵的可靠性。他们用三个不同的顶级AI模型(Claude-opus-4.7、Gemini-3.1-pro和GPT-5.5)分别作为参考模型重新计算技能熵,结果发现三套计算出来的难度排序有超过80%的一致性,说明技能熵确实反映了一种客观的、不依赖于特定AI系统的切换难度。此外,他们还请四位不了解研究内容的人类评注者,在不知道任何技能熵分数的情况下,从9道任务里选出他们认为最难和最容易切换的各3道。结果,人类评注者的选择与技能熵给出的排序有63%的吻合率,而评注者彼此之间的吻合率也只有75%,说明技能熵的判断接近于人类的直觉上限。
三、Skill?-Bench:一个专门测试"切换脑子"能力的考场
有了技能熵这把尺子,研究团队接下来搭建了一个专门的评测体系,叫做Skill?-Bench。
这个评测体系覆盖9个领域:数学、科学、编程、逻辑、信息提取、规划、创意写作、情境记忆和指令遵循。其中前6个领域有客观标准答案可以自动评分(比如数学题对不对、代码能不能跑通),后3个领域没有唯一正确答案,需要用AI作为评分员按照预设标准打分。9个领域合计涵盖558种具体技能,覆盖范围相当广泛。
每道评测题都是一个由2到10个步骤组成的任务链,每个步骤调用不同领域的不同技能,且后面的步骤必须依赖前面步骤的答案才能完成。所有步骤被包裹在一个统一的场景故事里,比如"一个机器人在洞穴系统里营救被困研究员"或者"一次受约束条件限制的会议出行规划"。研究团队在论文的附录里给出了完整的题目示例,包括一道5步技术型任务(技能序列依次为几何计算、演绎推理、规划、字数限制写作和创意头脑风暴)和一道6步场景型任务(技能序列依次为信息检索、算术、行程规划、实体追踪、约束满足和故事写作)。
根据任务级技能熵的高低,所有题目被分成低、中、高三个难度级别。评测时,每道题以两种模式提问:一种是把所有步骤单独隔离开来逐一提问(单技能模式),另一种是把完整的多步任务一次性给AI解答(跨技能模式)。两种模式分别展现AI在"只会一种技能"和"需要切换技能"时的表现差距。
研究团队在这个评测集上测试了12个模型,其中包括8个商业前沿模型(Claude-haiku-4.5、Claude-sonnet-4.5、Claude-opus-4.7、Gemini-3.1-flash、Gemini-3.1-pro、GPT-5.4-mini、O4-mini和GPT-5.5)以及4个开源模型(Qwen3-4B、Qwen3-8B、Qwen3-32B和Olmo-3-7B-Think)。每道题对每个模型采样4次,取平均分作为最终结果。
四、评测结果:越难切换,表现越差,无一例外
评测结果非常清晰。几乎所有模型都表现出同一个规律:随着任务的技能熵从低到高,准确率单调下降。对于Claude-opus-4.7、GPT-5.5和Gemini-3.1-pro这样的最强模型,下降幅度相对较小,大约只有几个百分点;而对于规模较小的模型(如Claude-haiku-4.5和Qwen3-4B),下降幅度明显更大。
跨技能模式相比单技能模式的准确率下降,幅度从4%到13%不等,在规划类技能上下降最为明显。更令人印象深刻的是,即便是模型在单技能模式下几乎能答满分的技能(比如逻辑推理对于某些强模型),一旦放进跨技能任务里,准确率也会出现明显下滑。这说明技能切换是一种独立于单项技能熟练度的能力维度——你在一门功课上做到100分,并不意味着你能在需要同时用几门功课的综合题里保持同样的表现。
研究团队通过仔细分析失败案例,找到了主要的失败模式:在任务的较后步骤中,AI非常容易把上一步的技能风格"复制粘贴"到下一步,而不是切换到当前步骤真正需要的技能。论文里有一个典型案例:一道题的第一步是几何计算,模型算出了面积4096。第二步要求基于这个结果做创意写作,想一个展览主题。但基础模型在第二步继续沿用了几何分析的技能框架,给出了一个简短的几何分析答案,而不是一段有创意的展览标题文字。
还有一个量化发现特别值得关注:对于最强的几个商业模型,当某个步骤选错了技能类别(比如本来应该调用写作技能却调用了数学技能),那一步的准确率会直接减半。选对技能类别是答对那一步的先决条件,技能识别的错误会直接拖累答题质量。
从领域层面来看,技能熵的分布也揭示了一些有趣的结构。规划领域切换到信息提取领域的技能熵最高,是整个9×9矩阵里最难的切换方向。科学领域虽然单独答题准确率很高(说明科学题本身不难),但它的平均技能熵却是最高的,意味着科学技能高度专有化,和其他领域之间的相互切换特别困难。这印证了一个朴素的直觉:某件事做起来不难,不代表在做完它之后马上去做另一件完全不同的事就很容易。
五、Skill-Entropy RL:用"切换难度"来训练AI
诊断出问题之后,研究团队的下一步是想办法解决它。他们提出的方案叫做Skill-Entropy RL,核心思路是:既然技能熵能衡量切换有多难,那就把它变成一个训练信号,让AI在练习中主动学习如何正确切换。
训练方案分两个阶段进行,可以理解为"先示范,后练习"。示范阶段(SFT热身):用一个更强的AI(Qwen3-8B)给出示范答案,每个答案除了包含最终答案之外,还额外标注了每一步用的是哪个技能。这些带标注的示范答案用来对待训练模型(Qwen3-4B-Instruct或Qwen3-1.7B)进行初步微调,让它学会按照这种格式输出。练习阶段(RL强化):模型继续在更多题目上练习,每次练习后根据两个维度打分。第一个维度是答案对不对(答案奖励),第二个维度是技能序列对不对(技能熵奖励)。两个维度按照7:3的权重合并成最终奖励信号,7分给答案,3分给技能序列。
技能熵奖励的计算方式也值得细说。模型每次给出答案的同时,还需要说明每一步用的是什么技能。系统会把模型预测的技能序列和标准答案的技能序列分别算出各自的任务级技能熵,然后看这两个熵值在训练数据的整体分布里分别排在哪个位置,通过比较排名的接近程度来给出一个0到1之间的奖励分。这种基于排名而非绝对数值的计算方式,让奖励信号不会被不同任务之间的难度差异所干扰,更加稳定可靠。
另外,模型预测的技能名称未必和标准库里的名称完全一致(比如模型可能说"整数运算",而库里的标准名是"数论")。为了处理这种情况,系统会把模型输出的技能名称通过语义嵌入技术自动匹配到最接近的标准技能,只要语义足够接近就算匹配成功,避免因为措辞差异而错误扣分。
整个训练过程在8块H100显卡上完成,采用GRPO强化学习算法,超参数细节均在论文附录中完整公开。
六、训练效果:数字说话,提升幅度相当显著
训练结果的数字相当令人印象深刻。对于Qwen3-4B-Instruct,Skill-Entropy RL把它在Skill?-Bench上的总分从34.4%提升到了68.4%,几乎翻了一倍。对于更小的Qwen3-1.7B,分数从14.6%提升到了40.1%,提升幅度接近三倍。
与其他训练方法的对比也很清晰。仅做示范微调(SFT)能把Qwen3-4B-Instruct的分数提到55.8%。只用答案奖励做强化学习(即去掉技能熵奖励的普通GRPO)能达到58.8%。而加入技能熵奖励的完整方法达到68.4%,比普通GRPO高出9.6个百分点。研究团队测试的另外三个技能感知型训练方法(Skill-Distill、SkillRL和STAT)最高达到61.4%,也都被Skill-Entropy RL超越。
这一对比特别有说服力,因为普通GRPO和Skill-Entropy RL的唯一区别就是有没有技能熵奖励,所有其他设置完全相同。那9.6个百分点的差距,完全来自于"让模型知道自己应该用什么技能"这个额外信号。
更值得关注的是,训练数据只涵盖6个可验证领域,但在另外3个纯开放式领域(创意写作、情境记忆、指令遵循)的测试中,Skill-Entropy RL同样表现出色,尤其是在创意写作领域取得了最大的提升。这说明技能熵奖励训练出的能力不局限于它见过的领域,而是一种更通用的"切换技能"能力在新场景里的自然迁移。
研究团队还把Skill-Entropy RL的结果与基础模型在单技能模式下的表现做了对比。Qwen3-4B-Instruct在接受Skill-Entropy RL训练后,在跨技能模式下的总分(68.4%)已经超过了未经训练的基础模型在单技能模式下的总分(62.2%)。换句话说,训练后的模型在一次需要切换多种技能的综合任务里,比未训练的模型单独孤立地做每一个技能还要强。这意味着提升不只是"更擅长跨技能格式",而是连底层的单项技能能力本身也同步得到了增强。
研究团队还在Llama-3.2-3B-Instruct和Olmo3-7B-Instruct两个额外模型上重复了同样的实验,结果同样显示Skill-Entropy RL取得了最高的总分,证明这套方法不依赖于特定的模型结构,具有较广泛的适用性。
七、把这套方法用在现有数据上:无需改造,即插即用
研究团队还做了一件很有实际意义的事:他们验证了技能熵奖励可以直接用在现有的训练数据上,不需要专门构造跨技能任务。
他们选取了OpenR1-Math这个数学推理数据集(里面的题目是普通的数学题,不是特别设计的跨技能任务),用一个AI自动把每道题的解题过程拆分成若干步骤,并为每个步骤标注上技能标签。标注完成后,就可以用技能熵公式算出每道题的任务级技能熵,然后按照同样的SFT加RL流程训练模型。
结果发现,在OpenR1-Math的子集上训练时,普通GRPO的最终答案奖励会先快速上升,然后过早出现平台效应(也就是不再继续提升)。而加入技能熵奖励之后,模型在平台效应出现之后仍然继续稳步提升,最终达到了更高的水平。在六个数学评测基准(AIME24、AIME25、HMMT25、AMOBench、OpenR1-Math测试集和MATH)上,Skill-Entropy RL的平均分比普通GRPO高出1.9%,比基础模型高出7.7%,在每一个单项基准上均取得最佳成绩。
这个结果说明,技能熵不只是为跨技能任务专门设计的工具,它作为一种结构性的训练信号,在普通单领域数据上也有帮助,能让模型在推理过程中更清晰地意识到自己每一步在做什么,从而推理得更好。
八、在更广泛的测试集上的表现
为了确认Skill-Entropy RL没有"过度适应"Skill?-Bench,研究团队还在五个与他们的训练流程完全无关的外部评测基准上测试了训练效果,包括两个长程推理类基准(MuSR和LongBench-MuSiQue)和三个通用推理类基准(GPQA-Diamond、MMLU和IFEval)。
结果显示,在这五个外部基准上,Skill-Entropy RL在两个模型规模上均取得了最高的平均分。具体来看,MuSR(需要多步推理的故事理解)上提升最明显,LongBench-MuSiQue上Qwen3-4B-Instruct取得了最佳成绩,MMLU和IFEval上也有提升,而且没有任何一个基准出现明显退步。这说明技能熵奖励带来的改善是真实的推理能力提升,不是对特定评测集的过拟合。
归根结底,这项研究做了一件看起来很基础却意义深远的事:把AI"切换脑子"这个能力从一个模糊的定性观察变成了可以精确衡量和主动优化的指标。技能熵的提出,让研究社区第一次有了一个统一的、跨模型的标尺,可以客观比较不同任务在技能切换层面的难度,也让训练AI更擅长切换有了具体可操作的路径。
对于使用AI助手的普通人而言,这项研究意味着未来的AI在帮你处理需要综合多种思维方式的复杂任务时会更可靠。当你让AI帮你分析一份财务报告,然后据此起草一封给客户的信,然后再根据信的内容制定后续行动计划——这种需要连续切换"数据分析→写作→规划"模式的任务,将来出错的概率会更低。
当然,这项研究也有值得进一步思考的地方。技能熵的计算依赖于一个参考模型,不同参考模型给出的结果虽然高度一致,但并非完全相同,这意味着技能熵并非完全客观的物理量,而是在一定程度上依赖于当前最强AI系统的能力边界。随着AI整体能力的提升,某些今天难以切换的技能对,明天可能变得轻而易举。如何让这把尺子随着时代更新而保持有效性,是一个值得继续探索的问题。
如果你对这项研究感兴趣,可以通过arXiv编号2608.05139查阅完整论文,也可以访问论文中提到的GitHub项目页面获取代码和评测数据集。
Q&A
Q1:技能熵和普通的任务难度有什么区别?
A:技能熵专门衡量"技能切换"的难度,而不是单个技能本身有多难。一道数学题可能很难,但如果一直在做数学,技能熵可能很低。而一道把简单数学和简单写作拼在一起的任务,技能熵可能反而很高,因为切换本身带来了额外困难。两者是相互独立的维度,技能熵揭示的是传统难度评分看不见的那一面。
Q2:Skill-Entropy RL训练完之后,AI是不是只擅长Skill?-Bench里的题型了?
A:不是。研究团队在五个完全无关的外部评测基准(MuSR、LongBench-MuSiQue、GPQA-Diamond、MMLU、IFEval)上测试了训练后的模型,结果显示在所有基准上表现均有提升或持平,没有出现退步。说明技能熵奖励训练的是一种通用的"切换感知"能力,而不是对特定题型的过拟合。
Q3:Skill?-Bench和现有的AI评测基准相比有什么本质不同?
A:现有大多数评测基准每次只测一种技能,比如数学基准只测数学,编程基准只测编程,即便是综合性基准通常也是把不同领域的题目混在一起分别评分,而不是要求模型在单道题里连续切换技能。Skill?-Bench的核心区别在于:每道题明确要求模型在解题过程中切换不同领域的技能,并且用技能熵量化了每道题在切换层面的难度,从而能够观察到随着切换难度增加模型表现如何系统性下降,这是传统基准完全看不到的维度。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.