网易首页 > 网易号 > 正文 申请入驻

AI 训练自己就能变强?答案藏在两个互不相识的模型互相打分里

0
分享至


2025 年,如果你问一个做大模型的人:"现在训练推理能力最大的瓶颈是什么?"

十有八九他会告诉你:不是算力,是标注数据。

你可能觉得这很奇怪。大模型不是应该越来越聪明,越来越不需要人管吗?但事实恰恰相反,越往后训练,麻烦越大。因为要让模型学会做数学题、写代码、解物理题,你得先告诉它"这道题的正确答案是什么",这样它才能知道自己做对了还是做错了。可当模型的推理能力已经超过大多数人类标注员的时候,谁来告诉它答案对不对?

这不是一个遥远的假设问题。现在最前沿的模型在一些数学竞赛题上的表现已经超过了普通的标注团队,继续雇人标注不仅贵,可能还标错了。

于是研究者们想了一个办法:既然没有标准答案,那就让模型自己给自己打分。这个思路叫**自我奖励**

> 自我奖励(Self-rewarding):模型不依赖外部标注,而是根据自己生成的多个答案,用投票、置信度等方式自己判断对错,然后拿这个判断结果当作训练信号。

听起来挺聪明对不对?但这篇论文要讲的第一件事,就是这个聪明办法背后藏着一个致命的坑。

一个人自己给自己打分,会出什么问题

设想一下这个场景:你让一个学生做十道题,然后规定"多数答案一致的那个就算对"。如果这个学生对某类题目本身就有系统性的理解偏差,比如他一直把某个物理公式记错了,那他做十次这道题,大概率十次都用错了公式,也就是说十次答案都指向同一个错误结果。

按照"多数投票即为真理"的规则,这个错误答案反而会被判定为"正确",然后被当作训练目标反过来加强这个错误。

这就是自我奖励的核心问题:**如果奖励信号来自模型自己的输出,那么模型的偏见没有任何外部力量去打破,只会被不断放大**

论文里管这个叫"自我确认"的动力学,后面我们会看到严格的数学证明。但直觉上很好理解:你没法靠一个人自己检查自己的作业来发现他真正不懂的地方,因为他不懂的地方恰恰是他自己也检查不出来的地方。

论文测试了几种主流的自我奖励方法,包括根据多数投票打分的 TTRL、根据模型对自己答案的置信度打分的 Intuitor、根据预测熵打分的 RENT,结果都出现了同一种现象:训练到后期,模型的输出越来越单一,多样性坍缩,甚至直接训练崩溃。

论文里图 4 画出了这个过程,你能清楚看到 RENT 这类方法的奖励方差迅速趋近于零,回复长度突然暴增或者直接发散,模型准确率随之掉头向下。这不是偶然的实验失误,是这套机制注定会走到的地方。

找一个不认识的人来打分

那怎么破这个局?

论文提出的思路其实很朴素:既然一个人自己检查不出自己的问题,那就找另一个人来检查。

这个另一个人得满足一个条件,他的犯错模式跟你不一样。如果两个人在同一类题目上犯同样的错误,那互相检查也没用,还是会一起认错为对。这背后的原理其实是机器学习里一个很老的概念,叫协同训练。

> 协同训练(Co-training):1998 年由 Blum 和 Mitchell 提出的理论,核心思想是如果两个"视角"彼此独立,一个视角犯的错误另一个视角大概率不会犯同样的错误,那么让它们互相提供监督信号,就能获得比单独训练更好的效果。

基于这个思路,论文提出了他们的方法,叫 **CO-RL**

> CO-RL(Co-Reinforcement Learning,协同强化学习):让多个互不共享参数、互不传递梯度的独立模型,同时在同一批无标注题目上生成答案,然后彼此把对方的多数投票结果当作"标准答案"来打分,各自用这个分数训练自己。

这里有个细节特别重要:训练的时候,两个模型之间完全没有梯度交换,没有参数共享,唯一的联系就是奖励信号。A 模型看 B 模型的答案给自己打分,B 模型看 A 模型的答案给自己打分,两条训练线各走各的,只在"打分"这一步产生交集。

这就好比两个从没见过面、背景经历完全不同的阅卷老师,各自独立批改同一份试卷,然后把两人的判卷结果互相对照。如果两位老师的知识背景差异够大,一个人漏看的错误另一个人往往能发现,这种交叉验证比一个人反复检查自己的答案要可靠得多。反过来说,如果这两位老师其实是师徒关系,学的是同一套教材,那交叉验证基本就退化成自我验证了,起不到纠错作用。

具体的训练机制是这样运作的:假设有两个智能体 A 和 B,面对同一道无标注的题目,各自独立采样出若干个答案。A 智能体的这些答案里,出现次数最多的那个答案,会被拿去当作 B 智能体的"参考答案",反之亦然。B 智能体生成的答案如果和这个参考答案一致,就得到奖励 1,否则得 0。这个过程用图 3 表示得很清楚,两条通路完全对称,谁也不用谁的梯度。

论文用的策略优化算法是 **GRPO**

> GRPO(Group Relative Policy Optimization,组相对策略优化):一种不需要额外训练价值网络的强化学习算法,做法是对同一个问题采样一组回答,把这组回答的奖励做组内标准化,得到每个回答相对于组内平均水平的优势值,再据此更新策略。DeepSeek-R1 等模型的训练中大量使用了这个算法。

如果不搞这套"互相打分"的机制,会发生什么?论文用一个对照实验说明了这点:把两个同样的模型各自单独用自我奖励方法训练,然后推理的时候把两者的回答简单合并投票,这种"伪装成多智能体"的做法效果明显不如真正的 CO-RL。数据摆在那里:文本任务上 CO-RL 集成后的平均分是 66.9,而两个独立训练模型简单集成的分数是 64.9,差了整整两个百分点。这说明关键不在于"多训练了一个模型",而在于训练过程中真的产生了跨模型的纠错。

差异性从哪里来,越大越好吗

既然核心逻辑是"两个视角要足够不同才能互相纠错",那接下来的问题就是:怎么让两个模型尽可能不一样?

论文给出了几条路径。

第一条路径是选用完全不同的模型家族。Qwen 和 Llama 在分词器、词表大小、架构选择、预训练语料上全部不同,Gemma 又用了 25 万词表和局部全局交替注意力这类独特设计。这些差异从预训练阶段就开始积累,模型学到的"思维习惯"天然不同。论文附录里专门做了一个量化实验,衡量不同模型对之间的错误重叠率。结果发现,同一模型家族内部(哪怕换个随机种子)的错误重叠度普遍偏高,卡帕系数(Cohen's κ)在 0.51 到 0.58 之间,而跨家族模型对的卡帕系数能降到 0.31 到 0.42。

> Cohen's κ:一种衡量两个分类结果一致程度、并排除随机巧合影响的统计指标,数值越低说明两者的判断越不相关,也就是错误越不重叠。

翻译成人话就是:同一个模型换个种子重新训练一次,出错的地方还是差不多;但换一个完全不同架构的模型,出错的地方明显不一样。这个发现直接支撑了论文的核心主张,跨家族搭配比同家族搭配的纠错能力更强。

第二条路径是模型规模的差异。不同参数量的模型天然有不同的推理风格和能力边界,一个 7B 模型和一个 3B 模型面对同一道题,错的地方往往也不一样,这也是一种天然的互补性来源。

第三条路径最有意思,叫数据解耦。论文用 DeepSeek-V3 把 MATH 数据集里的每道题改写成一个新场景,比如原题是"三角形 ABC 中 AB=AC=14,BC=26,求最短角平分线长度",改写后变成"一个三角形公园两条边长 14 米,第三条边 26 米,城市打算修一条最短的角平分线步道",答案不变,但表述完全不同。然后一个智能体学原题,另一个学改写版。这样即便是同一个基座模型,也不会因为死记硬背某种题目表述方式而产生一模一样的偏差。

这三条路径其实分别对应着"模型不同""规模不同""看到的题目表述不同"三种维度的差异化,论文管这套组合拳统一称为提升"队伍多样性"(cohort diversity)。而实验证明,这个多样性越高,效果越好。图 2 里能看到一个很直观的趋势:跨家族训练的两个模型,彼此之间的一致率(agreement)走势比同家族的更平稳,伪标签准确率更高,最终在 MATH-500 上的准确率也更高。

如果反过来想,用两个完全一样的模型互相监督会怎样?论文其实也测了这种"同家族"设置,结果显示确实还是有提升(比基座模型提升 8.0% 和 4.0%),但幅度明显不如跨家族设置。这说明"互相监督"这个框架本身有用,但"差异有多大"直接决定了这套机制能挖出多少潜力。

数学上到底发生了什么

前面讲的都是直觉和实验现象,但论文还给出了一套严谨的理论证明,这部分挺硬核,值得拆开看看。

论文把问题简化成一个二元模型:假设某道题只有"对"和"错"两种结果,用 p 表示模型答对这道题的概率。训练过程就是看 p 怎么随时间演化。

在自我奖励的情形下,论文证明了一个很扎心的结论,叫**自我确认动力学**(self-confirming dynamics):只要 p 一开始小于 0.5,也就是模型本身在这道题上"更倾向于答错",那么随着训练进行,p 会持续下降,最终收敛到 0。反过来如果 p 一开始大于 0.5,则会收敛到 1。

这意味着什么?意味着自我奖励这套机制根本没有纠错能力,它只会把模型原本的倾向放大到极致,无论这个倾向对不对。这跟前面讲的"学生自己检查自己作业"的比喻完全对应上了:如果学生原本就有 60% 的把握认为某个错误答案是对的,自我奖励只会把这个把握越推越高,直到他百分之百确信一个错误的答案。

这个 pA + pB = 1 的分界线在数学上叫做"鞍点分割线",是整个系统的临界地带。

这个结论最厉害的地方在于它给出了一个具体的数值例子。假设 A 智能体在一半题目上有 90% 把握答对、另一半只有 20% 把握,B 智能体正好反过来,一半 20%、另一半 90%。两个智能体各自的平均正确率都只有 55%,用自我奖励训练,各自最多只能在自己"擅长"的那一半题目上收敛到正确,整体准确率停留在 50%。但用 CO-RL 训练,因为在每一道题目上 pA + pB 都等于 1.1,超过了临界值 1,所以理论上两个智能体在所有题目上都能收敛到正确答案,整体准确率达到 100%。

这个例子说明了协同训练真正的威力所在,不是要求每个智能体都很强,而是要求它们的强项能够互补。哪怕两个人各自水平平平,只要擅长的地方不重叠,合作起来就能远超各自单打独斗的上限。这就像一场接力赛,两个队员单独跑都跑不完全程,但如果一个人擅长前半程冲刺,另一个人擅长后半程耐力,接力棒交接得当,反而能完成一个人根本完不成的距离。如果不这样安排接力,而是让两人各自重复跑同一段最拿手的赛程,看似都在"发挥所长",实际上团队整体成绩反而被限制在了各自的舒适区里。

实验结果:从数学题到看图说话

理论讲完了,实际效果到底怎么样?

论文在文本和多模态两条线上都做了大规模验证。

文本方面,训练数据用的是 MATH 数据集里难度 3 到 5 级的题目,测试覆盖七个基准,包括小学数学题 GSM8K、竞赛数学 MATH-500 和 AMC、代码生成 HumanEval、MBPP 和 LiveCodeBench,还有需要广泛知识面的 GPQA。

| 方法 | GSM8K | MATH500 | AMC | HEval | GPQA | MBPP | LCB | 平均 |

| 基座模型 | 73.4 | 56.6 | 28.9 | 39.0 | 21.2 | 52.2 | 13.7 | 40.7 |

| 有标签训练(GT-Reward) | 76.2 | 64.6 | 36.1 | 65.2 | 20.7 | 54.4 | 14.5 | 47.4 |

| TTRL | 80.4 | 66.4 | 31.3 | 63.4 | 22.2 | 51.8 | 15.9 | 47.3 |

| CO-RL(同家族) | 78.5 | 66.0 | 37.4 | 65.8 | 22.2 | 56.0 | 15.2 | 48.7 |

| CO-RL(跨家族) | 80.1 | 66.8 | 33.7 | 64.0 | 22.7 | 56.8 | 15.2 | 48.5 |

| **CO-RL(跨家族+数据解耦)** | **81.0** | 66.6 | 36.1 | 62.8 | 25.8 | 55.6 | **17.2** | **49.3** |

这是 Qwen2.5-3B 在这套体系下的表现,跨家族加数据解耦版本平均分达到 49.3%,比基座模型高出接近 9 个百分点,甚至超过了用真实标签训练的 GT-Reward(47.4%)。

多模态方面同样验证了这个规律。论文用 Qwen2.5-VL、InternVL3.5、Gemma-3 三个视觉语言模型家族,在 MathVision、MathVerse、MathVista、We-Math 四个多模态数学推理基准上测试。这几个模型家族在视觉编码器的选择上差异很大,Qwen2.5-VL 用的是原生动态分辨率 ViT,InternVL 用 InternViT,Gemma 用 SigLIP,这天然就是一种强多样性场景。结果是 CO-RL 在 12B 规模的 Gemma-3 上甚至超过了有标签训练的版本(47.56% 对 45.17%)。

论文还特意跟已有的多智能体强化学习方法 CoMAS 做了对比。CoMAS 需要一个额外的 LLM 裁判来给多轮辩论打分,机制更复杂,用了三个智能体。而 CO-RL 只用两个智能体,不需要任何裁判模型,最终平均分反而比 CoMAS 高出 4 个百分点(62.97% 对 58.94%)。这说明"引入外部裁判"这件事本身未必是必需的,只要智能体之间有足够的差异性,简单的交叉投票就够用了。

论文还进一步试了三个智能体同时训练的场景,把 Qwen2.5-3B、Llama-3.2-3B-Instruct、Qwen3-1.7B 放在一起互相监督,结果三个模型的平均提升幅度分别是 7.8%、6.0%、8.2%,证明这套框架不局限于两两配对,可以自然扩展到更多智能体组成的圈子。

训练过程中到底发生了什么变化

光看最终分数还不够直观,论文进一步观察了训练过程中的动态指标,主要是三个:验证集准确率、奖励标准差、回复长度。

图 4 里能看到一个很有代表性的对比。RENT 这类自我奖励方法,训练几十步之后奖励标准差就迅速塌陷到接近零,意味着模型对每一批回答的判断趋同了,同时回复长度突然暴增,这通常是训练走向崩溃的前兆信号。TTRL 相对稳定一些,但奖励方差还是逐渐下降,验证集表现也不如 CO-RL。而 CO-RL 全程保持奖励方差不塌陷,回复长度稳定,准确率持续爬升。

论文对多模态设置也做了类似观察,图 5 显示两个智能体之间的一致率(agreement)在训练过程中始终保持在一个不算太高的水平,同时它们交换的伪标签准确率却在持续上升。这个现象很关键:**两个智能体没有趋同成一模一样的行为,而是各自保留了独特性,同时给对方提供的参考信息越来越准**

这跟理论分析完全吻合。自我奖励的问题根源在于奖励来自智能体自己,一旦它对某个错误越来越自信,这份自信本身就成了奖励信号,形成正反馈死循环。CO-RL 打断了这个循环,因为奖励来自另一个视角完全不同的智能体,只要两者错误不完全重叠,纠错空间就一直存在。

写在后面

读到这篇论文的理论部分时,最触动我的其实不是 CO-RL 本身的设计,而是那个 pA + pB > 1 的临界条件。它把一个原本很模糊的直觉,"多样性有用",变成了一个可以计算的数字门槛。这意味着理论上你可以提前估算,两个模型配对之后到底有没有可能通过协同训练把彼此都拉到正确答案上去,而不是拍脑袋决定要不要凑一对。

论文里有个细节我反复看了几遍:同一个模型换一个随机种子重新训练,错误重叠率(卡帕系数)跟换一个完全不同家族的模型比起来,居然差距没有想象中那么小。这说明"多跑几次采样取平均"这种朴素的做法,可能远远达不到真正意义上的视角独立,这也解释了为什么单纯的模型集成(ensemble)效果不如跨家族协同训练。

还有一点值得琢磨:这篇论文其实暗示了一个更大的问题,当模型能力超越人类标注水平之后,"真理"该由谁来裁定?CO-RL 给出的答案是"没有绝对权威,但可以靠视角的多样性逼近它"。这跟人类社会里很多共识形成的机制,比如同行评审、陪审团制度,在逻辑上有种说不清道不明的相似性。这算不算是把一个古老的社会协作智慧,重新在机器学习里发现了一遍?

Q&A

Q1:CO-RL 是什么?

A:CO-RL 是一种不需要标注答案的多智能体强化学习方法,让多个互不共享参数的模型同时训练,各自用另一个模型的多数投票结果当作参考答案打分,从而在没有真实标签的情况下持续提升推理能力。

Q2:CO-RL 和自我奖励方法比如 TTRL 有什么本质区别?

A:TTRL 这类自我奖励方法用模型自己的多数投票结果给自己打分,容易把自身偏见不断放大导致训练崩溃;CO-RL 用另一个独立训练的模型的投票结果打分,两者错误不完全重叠,能互相纠正对方犯的错误。

Q3:CO-RL 需要两个模型完全不同吗,用同一个模型行不行?

A:同一个模型互相监督也能带来提升,但效果不如跨模型家族配置。论文实验显示模型家族差异越大、错误重叠率越低,最终训练效果越好,跨家族加数据改写的组合效果最佳。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2-1逆转露死亡之瞳!郑钦文破魔咒豪取4连胜 16岁柳托娃赛后捂脸痛哭

2-1逆转露死亡之瞳!郑钦文破魔咒豪取4连胜 16岁柳托娃赛后捂脸痛哭

颜小白的篮球梦
2026-09-01 03:24:45
降温超10℃!台风“沙德尔”余威尚存,湖北开学日天气抢先看

降温超10℃!台风“沙德尔”余威尚存,湖北开学日天气抢先看

极目新闻
2026-08-31 17:27:11
景甜:《我的前男友孙先生》

景甜:《我的前男友孙先生》

雨秋闲话
2026-08-30 11:44:36
上海一男子出轨同小区女邻居,原配称小三比她大10岁,评论区亮了

上海一男子出轨同小区女邻居,原配称小三比她大10岁,评论区亮了

子非鱼人
2026-08-28 00:30:23
中国大满贯参赛名单出炉:1大王牌回归,2人缺席,樊振东位列其中

中国大满贯参赛名单出炉:1大王牌回归,2人缺席,樊振东位列其中

娱瓜酱
2026-08-31 15:23:19
格力今年新招了6514名应届生,董明珠放话:宁可降工资也绝不裁员

格力今年新招了6514名应届生,董明珠放话:宁可降工资也绝不裁员

聚焦最新动态
2026-08-31 18:34:51
一场 4.7 万亿债务倒逼的地铁大洗牌:上海持续扩容,大批城市出局!

一场 4.7 万亿债务倒逼的地铁大洗牌:上海持续扩容,大批城市出局!

石辰搞笑日常
2026-09-01 00:35:30
从177到115斤,我才明白:清掉内脏脂肪,才是瘦下来的根本原因

从177到115斤,我才明白:清掉内脏脂肪,才是瘦下来的根本原因

解说阿洎
2026-08-14 01:01:23
耗资1亿,票房惨淡,请来20位明星也没用,影后新片惨败出局

耗资1亿,票房惨淡,请来20位明星也没用,影后新片惨败出局

情感大头说说
2026-09-01 01:15:19
前妻来看孩子,哄睡后准备走,我看着她的背影突然鼻子一酸,伸手从后面抱住了她,她身子一僵,没回头也没挣脱

前妻来看孩子,哄睡后准备走,我看着她的背影突然鼻子一酸,伸手从后面抱住了她,她身子一僵,没回头也没挣脱

晓艾故事汇
2026-08-30 10:34:02
王菲戴的zara花朵发抓火了,她把T恤剪了,李嫣穿黑白裙美极了!

王菲戴的zara花朵发抓火了,她把T恤剪了,李嫣穿黑白裙美极了!

嘴角上翘的弧度
2026-08-31 00:13:23
《重案六组:消失的警号》首播,观众差评一片!女主李沐宸成最大槽点

《重案六组:消失的警号》首播,观众差评一片!女主李沐宸成最大槽点

露珠聊影视
2026-08-31 17:56:01
孙宇晨认怂向景甜道歉!曝光两人私密另有隐情,原因炸裂更恶心

孙宇晨认怂向景甜道歉!曝光两人私密另有隐情,原因炸裂更恶心

茶韵浮生
2026-08-29 13:11:28
随着中国逆转黎巴嫩,日本+韩国大胜,男篮世预赛排名:中国第三

随着中国逆转黎巴嫩,日本+韩国大胜,男篮世预赛排名:中国第三

侃球熊弟
2026-08-31 21:33:46
Moodyz数字姬军团精选:集结吧!以数字为名的女优们

Moodyz数字姬军团精选:集结吧!以数字为名的女优们

孤独的独角兽影视
2026-08-31 09:55:15
华人女子在纽约街头泪崩,说美国一定会变好的,呼吁美国人团结奋斗!

华人女子在纽约街头泪崩,说美国一定会变好的,呼吁美国人团结奋斗!

怪味历史连连看
2026-08-30 16:27:10
无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

梦史
2026-08-29 06:21:20
国家动物博物馆标本损伤实图曝光!“家长一开始不承认触摸标本,听说每年防腐却马上洗了2分钟手”

国家动物博物馆标本损伤实图曝光!“家长一开始不承认触摸标本,听说每年防腐却马上洗了2分钟手”

BRTV新闻
2026-08-30 22:19:34
风波后景甜机场露面,打扮精致依旧明艳,唯独少了往日松弛感

风波后景甜机场露面,打扮精致依旧明艳,唯独少了往日松弛感

行者聊官
2026-08-29 16:08:53
发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

心理观察局
2026-08-01 07:10:30
2026-09-01 06:16:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9687文章数 568关注度
往期回顾 全部

科技要闻

起售不足18万!特斯拉在港澳推廉价Model 3

头条要闻

60米高空直击吉隆口岸 这就是泥石流曾吞噬的高度

头条要闻

60米高空直击吉隆口岸 这就是泥石流曾吞噬的高度

体育要闻

中国女婿用一份满分答卷,刺痛中国女排

娱乐要闻

女歌手陈粒疑被男子骚扰,本人回应

财经要闻

沃什美联储百日新政剧变:没有给答案

汽车要闻

A0级最长续航 极狐贝塔T1 550km版上市 7.68万起

态度原创

时尚
手机
亲子
艺术
家居

边开火,边关店:顶奢LV,店又没了?

手机要闻

苹果折叠屏iPhone正在测试手写笔:乔布斯当年最嫌弃的配件回归

亲子要闻

忍不了!美女吐槽备孕:现在男人的精子质量真的太差!

艺术要闻

被皇帝赶出画院的金匠,死后封神五百年

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版