网易首页 > 网易号 > 正文 申请入驻

当AI的老师自己也不会打分的时候,怎么办

0
分享至


有一种很奇怪的困境,你可能没想到过:一个AI模型要变得更聪明,靠的不是学习新知识,而是自己跟自己下棋。

这话听起来有点玄乎,但确实是这两年AI研究里一条越来越热的路子,叫做自我进化。简单说就是不再靠人类标注数据、不再靠人类出题,模型自己给自己出题,自己学着解题,然后循环往复,越滚越强。这条路子在数学、编程这类有标准答案的领域已经玩得很溜了,一道数学题对不对,代码能不能跑通,机器一眼就能判断,学习信号干净利落。

但问题来了。

如果是写一篇文章、给一条人生建议、编一个故事呢?这些事情没有唯一正确答案,好坏全凭感觉。这时候谁来当裁判?

这就是这篇论文要解决的核心麻烦。

一、当裁判自己也不进步的时候

先说清楚这套自我进化游戏是怎么玩的。

一般的做法里有两个角色:一个叫挑战者,专门负责出题,而且要出得越来越难;一个叫求解者,负责答题,要越答越好。这两者之间是一种对抗关系,挑战者想让求解者答不出来,求解者拼命想证明自己能答出来,一来一回,双方水平都在涨。这种设计思路其实来自更早的强化学习框架GRPO(组相对策略优化),一种通过组内比较来计算优势、更新策略的训练算法。

这套机制在数学题上工作得很好,因为答案对不对,机器自己就能判断,不需要额外找人来裁决。

但在写作文、提建议这种没有标准答案的领域,就必须找一个第三方来打分,这个角色叫裁判。裁判会给求解者的每一份答案打分,分数高的说明答得好,分数低的说明答得差,求解者就是靠这个分数信号来调整自己。

问题就出在这个裁判身上。

如果裁判是一个训练好之后就固定不变的模型,会发生什么?求解者会拼命学习裁判喜欢的风格,直到求解者的答案质量摸到了裁判能分辨的天花板。这之后再怎么训练,裁判也分不出高下了,因为在它眼里两份答案已经一样好。

这时候求解者就卡住了,不是因为它不能再进步,而是因为裁判看不出它到底有没有进步。

这就好比你请了一位钢琴老师来给你打分,这位老师自己只学过车尔尼练习曲的水平。你弹车尔尼弹得越来越好,老师能听出差别,给你打分很准。可你后来开始练肖邦的夜曲,弹得再有感情、再有层次,老师听起来都差不多,因为老师自己压根没到能分辨肖邦弹奏细腻差异的耳朵。你要是继续跟着这位老师学,进步就到此为止了,不是因为你弹得不好,是老师的耳朵跟不上了。如果这时候还硬要靠这位老师打分来判断自己该往哪个方向练,结果只会是原地打转甚至练偏。

这正是论文里反复强调的一句话:自我进化的上限,被裁判自身的评判能力锁死了。

二、思路:让裁判也跟着一起进化

这篇论文提出的框架叫J-ZERO,全称是从零数据出发的裁判协同进化。它的解法听起来简单粗暴:既然裁判会成为瓶颈,那就让裁判也动起来,跟挑战者和求解者一起进化,而不是训练完就锁死不动。

但这里立刻冒出一个逻辑陷阱。

如果挑战者、求解者、裁判三个角色最初都来自同一个模型,那裁判要靠什么信号来提升自己?如果裁判的训练数据也是这个系统自己产生的,那不就是自己骗自己吗?一个人闭着眼睛给自己打分,分数怎么可能变得更准?

论文作者想明白了这件事的关键:不能让裁判的训练信号来自裁判自己的打分,必须找到一种在这个闭环系统里,天然就带着正确答案的比较对。

换句话说,得找到那种不需要裁判介入,靠系统结构本身就能确定谁好谁坏的场景。

论文里设计了两种这样的场景,我一个个说。

三、第一种信号:角色不对等带来的天然优劣

第一种叫角色不对等对,思路是这样的:挑战者的本职工作是出题,让求解者答不上来;求解者的本职工作是答题,尽力答好。

那如果让挑战者去回答自己出的题,会发生什么?

挑战者压根没有被训练成一个答题高手,它所有的训练信号都在教它怎么把题目出得更刁钻,从来没人奖励过它答得好不好。而求解者恰恰相反,它的每一次训练都是在打磨答题能力。

于是这里就出现了一个不需要裁判介入就能确定的优劣关系:同一道题,求解者的答案系统性地会比挑战者的答案好。这个优劣关系不是裁判打出来的分,是由这两个角色各自被训练的目标决定的,天然如此。

这就像一场厨艺比赛,请了一位专门负责设计刁钻食材组合的美食评论家,和一位天天在后厨练刀工火候的主厨。评论家的工作是想出最难搭配的食材清单,让主厨发挥不出来,评论家从来没练过颠勺和调味。你现在让评论家自己下厨做一道菜,和主厨做的同一道菜放在一起比,不用请第三方裁判尝味道,单凭常识就知道主厨做得更好。这个判断不靠裁判的舌头,靠的是两人各自练的是什么功夫。如果没有这层天然优劣关系,系统就只能干等着一个可能已经失灵的裁判来打分,永远没法给裁判本身补课。

论文把这种成对数据叫做角色不对等偏好对,把这些对子收集起来喂给裁判训练,用的是布拉德利-特里模型这种经典的偏好学习损失函数,专门用来从成对比较中学出打分能力。

四、第二种信号:拆开来做比一口气做得好

第一种办法有个缺陷。

如果只靠角色不对等对来训练裁判,裁判学到的上限也就是当下求解者的水平线,它能分辨出求解者比挑战者强,但分辨不出求解者还能强到什么程度。裁判永远只是在追认已经发生的水平,追不上求解者接下来要突破的天花板。

论文这里借用了一个更早的思想,叫迭代放大,核心逻辑是:一个复杂任务,如果拆成几个简单子任务分别解决,再把答案拼起来,往往会比一口气硬解出来的答案更完整更准确。

具体做法是,挑战者把一道难题拆成三到五个子问题,求解者针对每个子问题单独作答,再由挑战者把这些子答案整合成一份完整回答。这份整合出来的答案,和求解者自己一口气直接答出来的答案放在一起比。

论文观察到的规律是,拆解组合出来的答案系统性地优于一口气答出来的答案,因为求解者面对小任务时更可靠,面对大任务时容易漏掉细节或者逻辑跳跃。

这就好比你让一个刚学做饭没多久的人一次性做一桌满汉全席,他大概率手忙脚乱、顾此失彼,某道菜火候不到,某道菜忘了放盐。可如果把这桌菜拆成八道单独的菜,一道一道地做,每道菜他都能专心对付,最后拼出来的满汉全席质量反而比他硬着头皮一次做完要好得多。这里的关键不是他做菜水平提高了,而是任务被拆小之后,他犯错的概率降低了。如果没有这套拆解流程,裁判就只能看到求解者一口气作答时的天花板,永远看不到求解者其实还有更大的潜力没被激发出来,自然也学不会怎么给更高质量的答案打高分。

这一类偏好对叫子任务放大对,同样用来训练裁判。

角色不对等对和子任务放大对合在一起,构成了裁判训练的全部数据来源,论文里用了个很形象的说法:这两种信号在训练的不同阶段各自可靠,合在一起才能让裁判在整个自我进化过程中始终有饭吃。

研究团队专门做了验证,请了一个外部大模型作裁判,去检验这两类偏好对里"谁更好"的标注到底准不准。结果发现角色不对等对从训练一开始就很可靠,求解者的胜率一直在六成以上;而子任务放大对在训练早期反而不太准,前三轮胜率只有两成出头,因为这时候求解者水平还太弱,连子任务都答不好,拆解反而帮了倒忙。但从第四轮开始,子任务放大对的胜率翻过五成,后来稳定在七成到八成,说明求解者成熟之后,拆解组合的优势才真正显现出来。

两条曲线在训练中段交叉,这个细节挺妙的,角色不对等对负责撑住早期,子任务放大对负责接手后期,裁判从头到尾都有靠谱的信号可学。

五、三方博弈:挑战者、求解者到底是怎么打起来的

说完裁判怎么进化,再说回挑战者和求解者这两个老对手是怎么互相较劲的。

每一轮训练分三步走。

第一步,固定住求解者和裁判,单独训练挑战者。挑战者出一批题,求解者去答,裁判打分,挑战者要学会出那种求解者普遍答得差的题,这样它才能拿到高分励,因为它的目标就是让求解者的平均分越低越好。

但光是让题目变难还不够,论文里加了两道保险,一个是重复惩罚:如果挑战者投机取巧,老是出很相似的题目,会被扣分,这个通过计算题目之间的文本相似度,把长得像的题目归为一类,同类题目越多惩罚越重;另一个是格式检查,题目必须按规定格式包裹好,否则直接给最低分。

第二步,固定住挑战者和裁判,单独训练求解者。这一步之前还有个筛选环节,挑战者出了很多候选题目,但不是每道题都拿来练,而是专挑那些求解者多次作答后分数波动最大的题目。

这个筛选逻辑背后有理论支撑:一项研究证明,训练某道题带来的策略提升,下限就取决于这道题奖励分数的方差。方差越大,说明求解者在这道题上表现忽高忽低,说明这道题正好卡在求解者能力的边界线上,这种题目才最有练习价值。

这就像健身房里的私教给你选训练重量。如果重量选得太轻,你每次都能轻松举起来,身体根本不需要适应,练了也白练;如果选得太重,你每次都举不动,也没法形成有效刺激。真正让你进步的,是那个你时而能举起来时而举不起来的临界重量,私教盯着的就是你举起这个重量时动作的稳定性波动,波动越大越说明这是你该练的重量段。如果私教随便选重量,不管你的实际波动表现,你要么原地踏步要么练伤自己。

第三步,才轮到裁判自己更新,用前面说的那两类偏好对,通过布拉德利-特里损失函数来调整参数。

三步走完算一轮,然后从头再来,一轮接一轮地循环。

六、数据说话:效果到底有多大

论文在两种规模的模型上做了实验,一个是40亿参数的Qwen3-4B-Base,一个是80亿参数的Qwen3-8B-Base,裁判用的是一个80亿参数的现成打分模型Skywork-Reward-V2。

对比的对象是两个同类框架,一个叫R-Zero,靠多数投票机制来获得奖励信号,是专门为有标准答案的领域设计的;另一个叫G-Zero,思路是用挑战者生成的提示来构造偏好对,但裁判是固定不变的。

在有标准答案的领域,涵盖数学推理、通用推理、指令遵循一共11个测试集,J-ZERO在40亿参数模型上比基础模型平均提升9.47分,比R-Zero还要高出4.74分,而R-Zero本来就是专门为这类领域设计的,J-ZERO居然还能反超。在80亿参数模型上,提升幅度是7.88分,同样超过R-Zero3.56分。

真正拉开差距的是那些没有标准答案的领域,涵盖开放式指令跟随、高难度问答、创意写作三类测试集。R-Zero在这里几乎失灵,提升只有3.08分和2.31分,差不多是它在有答案领域涨幅的一半,因为它依赖的多数投票机制本来就不适合开放式任务。G-Zero的表现更弱,只提升1.31分和2.08分,几乎跟没训练差不多,因为它压根没有引入裁判机制。

而J-ZERO在这个领域提升了11.23分和10.18分,涨幅最猛的是一个覆盖写作、商务沟通、生活建议、规划推荐等场景的综合测试集,40亿参数模型上从6.22分直接冲到28.56分,80亿参数模型上从12.93分冲到33.53分。

更值得说道的是训练轮次的表现。R-Zero和G-Zero都在训练到第二轮的时候达到顶峰,之后就开始掉头下滑,像是撞到了一堵看不见的墙。J-ZERO却一直在涨,论文里训练了整整十轮,始终没有停止改善的迹象。

论文还专门做了一个对照实验:把裁判固定住,只让挑战者和求解者互相较劲。结果这个固定裁判版本前三轮和完整版本表现差不多,但从第四轮开始就掉队了,最终比完整版本低1.66分到4.44分。这个分叉点正好对应求解者的水平摸到了固定裁判的判断天花板,之后裁判就分不清好坏了,信号变成了噪音。

七、拆开来看:两种偏好信号各自的贡献

论文还专门做了消融实验,把两种偏好数据分别拿掉,看看各自贡献多大。

去掉子任务放大对,总分从37.59掉到35.95,少了1.64分;去掉角色不对等对,总分掉到36.62,少了0.97分。子任务放大对的贡献更大,这和前面说的逻辑对得上,角色不对等对只能教会裁判分辨求解者比挑战者强,但没法让裁判看到超越求解者当下水平的答案是什么样;子任务放大对恰恰能提供这种超前样本,对持续进步更关键。

如果把裁判完全撤掉,回到最初那种固定评判、不做任何协同进化的设定,总分直接跌到34.54,这也印证了前面反复强调的那个核心结论:裁判本身要是不进步,整套系统的天花板就焊死了。

八、一个意外发现:裁判在标准测试上也变强了

论文原本的目的是让裁判跟上求解者的步伐,而不是让裁判本身变成更强的通用打分器。但研究团队还是顺手在一个独立的、跟训练数据完全无关的评测集RM-Bench上测了一下每一轮的裁判。

结果发现,裁判在所有四个测试维度上都在涨,平均准确率从92.61涨到93.95。涨幅最大的是聊天对话类场景,提升了3.70分,这恰好是最接近挑战者出题风格的领域;安全类场景本来就接近满分,几乎没有变化空间。

更有意思的是难度细分。这个测试集把偏好对按难度分成简单、正常、困难三档,困难档指的是那种回答风格和回答质量对不上的情况,比如一份措辞平实但内容扎实的回答,对上一份辞藻华丽但内容空洞的回答,裁判很容易被表面文采骗到。结果显示困难档的准确率从85.08涨到89.85,涨了4.77分;而简单档反而略微下降了0.74分。

这个反差其实合情合理。当求解者已经足够强,它很少再产生那种一眼假的低质量答案了,简单对比对裁判来说信息量本来就在变少;真正卡脖子的是那种文笔好但内容空的回答会不会骗过裁判,这才是决定求解者能不能持续被正确引导的关键点,而这恰恰是裁判进步最多的地方。

九、这套框架目前还做不到什么

论文也坦率承认了限制。

受限于算力,实验只做到了80亿参数规模,挑战者、求解者和裁判都没有超过这个体量,而且都是基础模型,没有测试过经过后训练、擅长写长链条推理过程的模型。更大规模下这套框架是否依然有效,还是未知数。

另外,论文里的裁判用的是一个判别式打分模型,直接输出一个分数,而挑战者和求解者共用同一套生成式初始化。论文提出了一个方向:如果裁判本身也是一个能够生成文字点评的语言模型,让点评本身成为一种更丰富的训练信号,会不会效果更好?这个问题作者留给了未来的工作。

写在后面

读完这篇论文,让我印象最深的其实不是最终的分数提升,而是那个训练中段两条曲线交叉的图。

角色不对等对早期可靠、后期逐渐失效,子任务放大对早期不可靠、后期逐渐接管,这个交叉点几乎是这篇论文里最朴素也最耐琢磨的一处设计。它说明一件事:任何一种单一的评判信号,都有自己的保质期,单靠一种信号硬撑到底,系统迟早会在某个阶段失灵。真正能撑住长期自我进化的,是懂得在信号即将失效之前,提前准备好下一种信号来接棒。

这个思路其实可以脱离AI训练本身来想。任何一个需要长期自我提升的系统,不管是一个人的技能成长,还是一个组织的迭代节奏,大概都逃不开这个规律:早期靠简单粗暴的对照就能判断好坏,越往后,评判标准本身就得跟着水涨船高,不然进步的人早晚会撞上一个跟不上他的裁判。

这篇论文没有回答的问题是,如果裁判本身也开始产生带偏见的判断,谁来纠正裁判的裁判?这个链条能不能一直往上叠,还是说总会在某一层撞上一堵真正的墙?

Q&A

Q1:J-ZERO是什么?

A:J-ZERO是一个让挑战者、求解者、裁判三个角色共同进化的自我训练框架,不需要任何外部人工数据,专门解决固定裁判会限制AI持续进步的问题,在有标准答案和没有标准答案的任务上都能用。

Q2:J-ZERO和R-Zero、G-Zero有什么区别?

A:R-Zero靠多数投票获得奖励,只适合有标准答案的领域;G-Zero用固定裁判构造偏好对训练求解者;J-ZERO让裁判本身也跟着挑战者和求解者一起持续更新,不会被固定裁判的判断天花板卡住。

Q3:J-ZERO的训练效果能持续多久?

A:论文测试了十轮训练,J-ZERO的表现一直在稳步上升,没有出现停滞或下滑;而对比的R-Zero和G-Zero都在训练到第二轮时达到顶峰后开始下降。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
近4万辆极氪001因电池一致性召回,欣旺达刚付威睿6.08亿和解

近4万辆极氪001因电池一致性召回,欣旺达刚付威睿6.08亿和解

周哥一影视
2026-10-01 08:09:14
中网深度复盘:郑钦文2-1险胜施晗,排名差 180 分背后藏两层真相

中网深度复盘:郑钦文2-1险胜施晗,排名差 180 分背后藏两层真相

小兰看体育
2026-10-01 16:52:57
严厉彻查!中央升级反腐“天网”!这类人一个都跑不了!

严厉彻查!中央升级反腐“天网”!这类人一个都跑不了!

职场资深秘书
2026-10-01 13:27:33
中国文坛有哪些被捧得过高的作品?

中国文坛有哪些被捧得过高的作品?

侃神评故事
2026-09-26 07:15:09
10个草书字,伟人手迹!我勉强读出6个,全看懂的,您书架上绝不止百本典籍!草书写到化境,笔随心动,何须再念字形?

10个草书字,伟人手迹!我勉强读出6个,全看懂的,您书架上绝不止百本典籍!草书写到化境,笔随心动,何须再念字形?

书画相约
2026-10-01 16:06:38
存储巨头,直线拉升!韩股翻红,日股大涨

存储巨头,直线拉升!韩股翻红,日股大涨

证券时报
2026-10-01 09:58:32
潜伏 11 年,那些被矿渣喂大的香蕉,终于开始向人类“复仇”了

潜伏 11 年,那些被矿渣喂大的香蕉,终于开始向人类“复仇”了

科普中国
2026-09-29 16:36:33
陪睡门主角魏莹奢靡生活曝光,豪车出行、到处旅游打卡,纸醉金迷

陪睡门主角魏莹奢靡生活曝光,豪车出行、到处旅游打卡,纸醉金迷

一曲一场談
2026-08-20 15:50:26
伊朗准备迎接末日战争?要是打不赢美国,就要让所有人都不好过

伊朗准备迎接末日战争?要是打不赢美国,就要让所有人都不好过

史智文道
2026-10-01 16:31:34
就在大家都以为中国会坚决回应时,北京却选择了战略克制。

就在大家都以为中国会坚决回应时,北京却选择了战略克制。

回京历史梦
2026-08-22 18:23:43
王虹出席纽约大学举办的庆功宴,罕见未戴眼镜,参会学生:王虹教授很文静,很多人来找她合影签名

王虹出席纽约大学举办的庆功宴,罕见未戴眼镜,参会学生:王虹教授很文静,很多人来找她合影签名

极目新闻
2026-09-30 17:00:36
19岁、酒驾、超载、凌晨:贵州7死车祸,没有一个“如果”

19岁、酒驾、超载、凌晨:贵州7死车祸,没有一个“如果”

奶油芒
2026-09-30 11:45:15
张予曦母女迪士尼同框,妈妈这颜值不输女儿,年轻时绝对是大美人!

张予曦母女迪士尼同框,妈妈这颜值不输女儿,年轻时绝对是大美人!

秋风悲画芯
2026-10-01 07:21:57
刘欢妻子卢璐发声!她已回到北京家中,请求朋友辟谣,还老公安息

刘欢妻子卢璐发声!她已回到北京家中,请求朋友辟谣,还老公安息

动物奇奇怪怪
2026-10-01 05:43:37
两名飞行员激烈肢体冲突致赴以客机迫降,特朗普:已就此事与内塔尼亚胡通话

两名飞行员激烈肢体冲突致赴以客机迫降,特朗普:已就此事与内塔尼亚胡通话

环球网资讯
2026-10-01 13:24:06
那个坐拥890万粉丝、体重一度逼近500斤的内蒙古网红“羊亡爷”恩克,步履虚浮难进食,暴食流量终要拿健康买单

那个坐拥890万粉丝、体重一度逼近500斤的内蒙古网红“羊亡爷”恩克,步履虚浮难进食,暴食流量终要拿健康买单

LULU生活家
2026-09-25 15:16:25
南京发生一交通事故致2人死亡,警方通报

南京发生一交通事故致2人死亡,警方通报

界面新闻
2026-10-01 17:01:52
民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

趣文说娱
2026-09-06 14:26:45
4-0横扫夺冠!国乒16岁新星崛起:偶像是马龙,追赶王楚钦林诗栋?

4-0横扫夺冠!国乒16岁新星崛起:偶像是马龙,追赶王楚钦林诗栋?

李喜林篮球绝杀
2026-10-01 11:26:49
南京市秦淮区原区长凌向前,被责令辞去省人大代表,8月葛飞已任秦淮区区长

南京市秦淮区原区长凌向前,被责令辞去省人大代表,8月葛飞已任秦淮区区长

江南江南
2026-09-30 15:45:02
2026-10-01 19:36:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10022文章数 569关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

C罗离开后葡萄牙队7号球衣疑光速易主 莱奥将披7号球衣

头条要闻

C罗离开后葡萄牙队7号球衣疑光速易主 莱奥将披7号球衣

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

教育
艺术
时尚
房产
军事航空

教育要闻

成都中考体考标准偏高,家长呼吁下调:教育局这样回应

艺术要闻

16幅 Alexander Shevelev风景油画

在米兰,用时装唤醒内心的自我

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版