![]()
这项由独立研究者发布的研究成果以预印本形式公开,论文编号为arXiv:2607.07690,发布于2026年7月8日,研究者来自独立机构thinkdense.ai。
在AI的世界里,有一个令人头疼的老问题,那就是让AI学会"更好地思考",而不只是"思考更多"。
当你让一个AI去解一道难数学题时,它往往会洋洋洒洒写上好几千字,不断地"嗯嗯嗯、等等、我再想想、让我重新考虑一下",来回兜圈子,最终也许凑巧给出了正确答案。但如果你仔细翻阅那长篇大论,会发现里面大部分都是在原地打转,真正有价值的推理步骤寥寥无几。这就好比一个学生考试时,与其在草稿纸上密密麻麻写满反复涂改的尝试,倒不如清晰写出三步推理直接解决问题——但偏偏现有的AI训练方法更容易培养出前者。
这个问题的根源在于目前最主流的AI强化学习训练方式,也就是所谓的"只看结果、不看过程"训练。训练系统会给AI出一道题,AI生成一堆解题过程,最后只看最终答案对不对,对了就打高分,错了就打低分。中间那长长的推理过程?对不起,没人评分。于是AI很快学会了一个取巧的策略:既然过程没人管,那就尽量多写,多试几次,碰运气总有一次答对。结果就是AI的"废话"越来越多,而真正的推理能力提升却极为有限。研究数据显示,经过标准训练后,AI生成的文字量可以膨胀十倍,但准确率的提升却微乎其微。
这项新研究提出了一个名为**Agon**(取自古希腊语,意为"竞赛")的全新框架,它用一个极为巧妙的方法绕开了这个难题:既然没办法直接给推理过程打分,那就让另一个AI来"隐式"评判它。
一、为什么自己盯着自己的卷子,永远找不到错误
要理解Agon为什么有效,先得搞清楚一件事:为什么让AI自己检查自己的推理,效果很差?
麻省理工学院等机构的研究者早就发现,大型语言模型在没有外部反馈的情况下自我纠错,往往是徒劳的。这背后有一个非常直觉性的道理:导致你犯错的那个"盲点",同样也会让你在自查时看不见那个错误。用一个生活中的例子来说,一个人写了一篇文章,里面有一个逻辑谬误,但他自己偏偏就是看不出来——因为他脑子里的思路从一开始就认为那个推理是对的。叫他自己改稿,他改一百遍也不会发现那个漏洞。但是换一个思维方式不同的人来读,可能一眼就看出来了。
现有的"自我博弈"类AI训练方法,本质上就是让AI和自己的过去版本下棋、和自己的历史答案较劲。这的确能带来一些提升,但很快就会触顶——因为整个系统里的"裁判"和"选手"本质上是同一批盲点的产物。Agon的核心洞见正在于此:真正有效的外部评判,必须来自一个有着**不同失误模式**的对手。
Agon的做法是:训练两个模型,让它们互相成为对方的"隐式裁判"。
二、竞赛规则:一个出题、一个挑战,轮流做"选手"
Agon的运作方式可以用一场即兴辩论赛来比拟。
每一轮训练开始,两个模型——姑且叫它们模型A和模型B——面对同一道难题。模型A先作答,写出自己的完整解题过程,然后系统会把A的解题总结(注意,不是那冗长的内心独白,而是它写出的正式解题步骤摘要,而且最终答案会被遮住)提供给模型B看。B在看完A的解题摘要之后,再去解同一道题。
B此时的任务不仅仅是解对题,还要**超越A**。如果A解错了而B解对了,B会得到额外的"转化奖励"——相当于额外加分。这就是竞争的核心:赢了弱对手没什么意思,关键是在对手犯错的时候你没犯错,那才是真本事。
在这个过程中,B看了A的解题摘要,实际上等于隐式地评估了A的推理质量。如果A的推理有漏洞,比如在某一步骤中搞错了正负号,而B从A的摘要中发现了这个问题并加以利用,那么A那条错误的推理就通过"竞争失败"这个结果得到了惩罚。整个过程中,没有人专门标注"哪一步推理好""哪一步推理烂",裁判完全由对手的表现来充当,干净、自然、不需要额外的人工标注。
为了防止某一个模型永远只当"出题者"或永远只当"挑战者"而导致能力偏科,每一步训练之后两个模型会互换角色。A负责出题的那一轮,B来挑战;下一轮B出题,A来挑战。就这样轮流切换,两个模型都在同时练习"从零解题"和"读懂对手、超越对手"这两种技能。
三、奖励机制的精妙之处:为什么不能简单地"赢了加一分"
Agon在奖励设计上花了不少心思,这里有一个容易踩的坑值得专门解释一下。
最直觉的竞争奖励可能是:B对了A错了,B加分;B错了A对了,B扣分;两个都对或都错,平局。这听起来很合理,但实际上有严重问题。因为A的对错是A自己的事,B的分数不应该受到A结果的"扣分"影响——数学上可以证明,这种"减去对手得分"的形式,在GRPO这种按组内平均标准化计算优势的训练框架下,相当于给每道题加了一个对B毫无方向性指导的噪音,最终和根本没有竞争压力的效果差不多,实验数据也印证了这一点(49分,接近合作模式的46分)。
真正有效的奖励是"转化奖励":B答对,并且A答错,这个组合才触发额外奖励。用公式来表达就是:奖励额外部分 = B答对 × (1 - A答对)。这个乘法结构的妙处在于,它把"竞争加分"直接嵌进了"B自身的答对"这个行为上,而不是从B的基础分里扣掉什么。这样,奖励对B的行为有清晰的方向性:在那些A都搞不定的难题上答对,是最值钱的。
更关键的是,每个挑战者B的8次尝试(训练时每题生成8个答案作为一组),每次都对应A的一个不同解题摘要,所以同一组里的"对手难度"是各不相同的。这种组内差异让"转化奖励"在数学上真正产生了方向性梯度,告诉B应该往哪个方向学。如果8次尝试都面对同一个A的答案(这是一个对照实验中的设置),那么对手难度在组内是固定不变的,转化奖励在标准化之后就会抵消掉,相当于没有竞争压力,实验结果也确实只有32分,和标准GRPO的30分相差无几。
四、两个模型,却几乎只需要一个模型的计算资源
这个方法听起来很美,但第一个实际问题就来了:养两个模型,不就是双倍的计算成本吗?
研究者的解决方案相当聪明:两个模型**共享同一个冻结的基础模型**,各自只是在上面挂了一套"LoRA适配器"(一种只训练一小部分参数、其余参数保持不变的高效微调技术)。这就好像两个人共用一套百科全书,但各自有一本不同的笔记本在旁边补充记录自己独特的心得。那本共享的百科全书是固定的,各自的笔记本才需要更新训练。
每个LoRA适配器大约只有1000万个参数,相当于整个基础模型的约2%。也就是说,从一个模型升级到Agon的双模型竞争框架,额外的内存开销大概只有2%,而不是100%。这在工程上是完全可接受的。
两个适配器从不同的初始状态出发——一个从标准的零初始化开始,另一个从一个随机扰动的初始状态开始——加上每步轮换角色带来的不同训练梯度,让两个看似几乎一样的模型随着训练的推进,逐渐发展出不同的"思维盲点",从而真正形成互补。
五、实验结果:数字背后的真实含义
研究者在一个叫做DeepMath-hard的极难数学题数据集上测试了Agon,这个数据集的题目对于0.6亿参数的小模型而言堪称噩梦级别,零样本情况下(不做任何特殊训练,直接让模型答题)的正确率只有23%。
经过标准的GRPO强化学习训练,正确率提升到了30%——提高了7个百分点,代价是模型生成的文字量从平均6100字膨胀到了8100字。印证了前面说的"废话变多但能力没多大提升"的问题。
如果在推理时让两个原版模型互相看对方的答案并修改自己的答案(这叫"Mixture-of-Agents",即混合智能体方法,不需要特殊训练),正确率是34%——比单模型GRPO多4个百分点,但这4个百分点的提升成本是两倍的推理计算量。
换成Agon——同样两次推理的计算量,正确率直接跳到了61%。这是零样本基线的2.65倍,是标准GRPO的两倍多,是无训练混合智能体方法的1.8倍。
更耐人寻味的是,Agon的最终推理过程反而变短了:平均只有3500字,而标准GRPO是8100字。也就是说,Agon不仅答得更准确,还说得更简洁。这个缩短效果并不是人为加了"少说废话"的奖励触发的,而是竞争压力的自然产物——当有另一个模型在对面盯着你的解题思路找漏洞时,你自然会把真正有价值的步骤写出来,而不是用大量探索性废话来凑数。
在这31个百分点的总提升中,"信息交流"这个因素(让模型看到对方的解题思路)贡献了约16个百分点,"竞争压力"这个因素(在看到对方答案的基础上再引入转化奖励)又额外贡献了约15个百分点。两者对最终效果的贡献旗鼓相当。
这两个核心结论——交流有效、竞争比合作更有效——在统计上都超过了置信区间的误差范围(在300道题的样本上,双侧95%置信区间约为±5.5个百分点),可以被视为可靠的结论。
六、举一反三:小模型受益更大,换个领域也管用
研究者还在不同规模的模型上测试了Agon,结论非常直接:模型越小,Agon带来的提升越大。0.6B(6亿参数)的小模型提升了31个百分点,1.7B的提升了24个百分点,4B的提升了12个百分点。这个规律背后有直觉性的解释:越小的模型越难对付困难题目,越处于那个"废话增多但准确率不升"的困境,所以竞争框架带来的改变也越显著。
经过Agon训练的0.6B小模型(正确率61%)在这个数据集上甚至超越了零样本状态下的4B模型(正确率52%),也超越了经过标准GRPO训练后的4B模型(正确率59%)。也就是说,7倍大的模型按常规方式训练,反而打不过Agon加持的小模型。
同样的框架在Qwen3.5系列和Gemma 4系列模型上也验证了同样的排序规律,证明这不是某个特定模型家族的偶然特性。
此外,研究者还把Agon用在了竞争性编程代码生成领域,用单元测试通过率代替数学答案正确性作为评判标准。结果同样呈现同样的规律:标准GRPO是24%,合作模式是29%,Agon是34%,代码生成时的推理过程也相应缩短了。代码领域的绝对提升幅度小于数学,部分原因是代码题的对手摘要更长,给推理过程带来更多"噪音",但方向性结论是一致的。
为了验证这些提升不是因为模型在数学训练集上"背题"造成的,研究者还在GSM8K(一个常见的初中数学题集)和MATH-500(高中难度综合题集)上做了转移测试,不做任何额外训练,直接用在DeepMath上训练好的Agon模型去答题。结果显示,在GSM8K上正确率从62%提升到了75%,在MATH-500上从45%提升到了64%,排序与训练集上的表现一致,说明Agon带来的是泛化性的推理能力提升,而不是对特定题目的过拟合。
七、一些值得诚实说明的局限与开放问题
这项研究在结论部分非常诚实地列出了若干局限,这是值得认可的做法。
首先,Agon需要一个"验证器"——一个能够自动判断答案对错的机制。数学题和编程题有标准答案,验证器很好搭建,但对于那些没有唯一正确答案的开放性任务(比如写作、策略分析),Agon目前无法直接应用。
其次,两个模型之间"势均力敌但行为各异"这个条件,在现有的双适配器实现中只是一个被维护的假设,而不是一个被精确量化的属性。研究者坦承,两个适配器在训练初期几乎一模一样(只有微小的随机初始化差异),能否在训练过程中真正发展出有意义的互补性,目前只是一个"假说",并没有被单独测量验证。
再者,每个训练配置只跑了一次(单次实验),没有重复多次取平均,这意味着数字本身有一定的随机性,具体数值可能会随训练随机性而波动。研究者明确说明了这一点,要求读者在解读那些接近置信区间边缘的数值时保持谨慎。
还有一个有趣的悬而未决的问题:论文中"没有信息交流但有竞争压力"这个理论格子,在当前实现下由于数学原因是"自动失效"的——如果挑战者根本看不到对手的解题思路,对手的对错在组内就是一个常数,那个竞争奖励项在数学归一化之后就消失了。这意味着"纯竞争(无交流)"到底有没有独立价值,目前的实验设计无法给出明确答案,需要另外设计实验来研究。
最后,Agon的推理部署是两阶段串行的——先让一个模型出答案,再让另一个模型读后输出最终答案——这意味着实际推理时间是单模型的两倍。研究者也坦承,所有"更短的推理过程"的比较,都只比较了第二阶段(挑战者阶段)的长度,并没有把第一阶段(起草者阶段)的生成长度算进去,完整的推理算力账还有待更细致的核算。
八、下一步:让两个AI不用说话、直接交换思维
研究者在展望部分提出了一个非常前沿的研究方向:目前两个模型之间的"交流"是通过自然语言(文字)进行的,而语言是有带宽限制的——很多模型"知道"的东西,它们并不能完整地用语言表达出来。
如果能让两个适配器直接在"隐状态"(模型内部的数值向量,也就是模型真正的思维媒介)层面交换信息,绕过语言这个瓶颈,理论上可以传递远比文字更丰富的推理信息。这可以通过让一个模型的中间层激活值直接注入另一个模型的上下文来实现(技术上叫做KV-cache注入或门控潜在空间桥接)。研究者把这称为"让它们在潜在空间中共同推理",并明确将其列为未来最重要的研究方向。
另外,研究者还提到了一个颇具启发性的"密度调节"方向。实验中发现,当竞争对手的解答也是正确的时候,额外设置一个"用更少的字比对手解对同一道题"的加分项,可以在准确率几乎不变(从61%降到60%)的前提下,把推理过程从平均3500字进一步压缩到2600字。这意味着竞争框架不仅可以用来提升准确率,还可以作为一个可调节的旋钮,有目标地优化推理效率。
说到底,Agon做的事情,用一句话来概括就是:把AI的"自我评判"问题,变成了一场由结果来说话的竞赛。不需要专家标注哪个推理步骤是好的、哪个是多余的,不需要训练一个专门评判推理质量的额外模型,甚至不需要改动现有的训练框架——只需要让另一个有着不同思维盲点的模型来"隐式地"告诉你,你的推理哪里被人抓住了漏洞。在数字上,这让一个小模型在极难数学题上的正确率翻了两倍多;在工程上,这几乎不带来额外的计算成本;在理论上,这开辟了一个全新的思路:AI模型的训练信号,可以来自同伴的竞争,而不只是来自自己的回顾。
这项研究的更多细节,包括完整的实验数据、数学推导和代码细节,可以通过论文编号 arXiv:2607.07690 在arXiv预印本平台上查阅完整原文。
Q&A
Q1:Agon框架和普通的让两个AI互相参考答案有什么本质区别?
A:普通的多模型合作(比如Mixture-of-Agents)是让模型看完对方的答案后修改自己,目标是"达成共识"。Agon的核心差异在于竞争压力:挑战者不是为了和起草者达成一致,而是为了在起草者犯错的地方答对,额外获得"转化奖励"。这种奖励结构让模型主动学会识别对手推理中的漏洞,而不是跟着对手的思路走,最终形成的能力是互补的,而不是趋同的。
Q2:Agon训练出来的模型推理变短了,是因为被惩罚了废话吗?
A:不是。Agon的主要奖励函数里完全没有长度惩罚项。推理变短是竞争压力的自然副产品:挑战者在阅读对手的解题思路后,已经知道了解题的大致方向和哪些路走不通,不需要重复那些无效探索,所以自然而然地变得更简洁。这种缩短效果是涌现出来的,并不是被强制要求的。研究者另外设置了一个可选的"长度决胜项",可以进一步把推理从3500字压缩到2600字,但那是独立于主要框架的附加选项。
Q3:Agon需要什么特殊的训练基础设施才能运行?
A:基本上不需要。Agon被设计为可以在标准的GRPO训练框架上直接运行,无需修改优化器的核心代码。两个模型以LoRA适配器的形式共享一个冻结的基础模型,额外内存开销约为2%。研究者使用的是开源的vLLM推理框架和TRL训练库,都是业内常用工具。唯一需要特别处理的工程点是:每次训练步骤需要先跑一遍起草者生成答案摘要,再把摘要拼入挑战者的输入上下文,实现上需要协调两次生成的时序,但这并不需要定制硬件或专有框架。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.