网易首页 > 网易号 > 正文 申请入驻

一个30B小模型如何在数学证明上追平DeepSeek

0
分享至


2026年,一个叫SU-01的数学推理模型在IMO(国际数学奥林匹克竞赛)级别的证明题上拿到了金牌水准的成绩,能连续输出超过10万个token的自然语言推理过程去啃一道奥数题。这事本身已经很厉害了,但更有意思的问题是:这种"超长思考"的能力,能不能教给一个更小、更朴素的模型?

答案是可以,但过程比想象中坎坷得多。

上海人工智能实验室的团队做了这样一件事:把SU-01当老师,把Qwen3、Intern-S2、GLM-4.7、Gemma-4这些"短思考"的学生模型拉过来补课。结果最亮眼的一个学生,Intern-S2-Preview,在权威证明测试ProofBench上从34分直接冲到55.2分,涨了21.2分,超过了Gemini-2.5-Pro。

这背后是一套叫SimpleOPD的训练方法,而它诞生的原因,是研究者们撞上了一堵墙,然后想办法把这堵墙拆掉的过程。

老师和学生说的不是一种语言

先说说这堵墙到底是什么。

要把一个模型的推理能力"传"给另一个模型,业内早有一套成熟做法,叫**在线策略蒸馏**。

> 在线策略蒸馏(On-Policy Distillation,简称OPD):不同于传统蒸馏用老师提前生成好的答案去喂学生,OPD让学生模型自己先生成一段回答,然后老师模型实时给这段回答的每一个词打分(也就是评估这个词在老师看来"该不该说"),学生根据这个逐词打分来调整自己。这种方式信息更密集,学生不容易"学傻",泛化能力也更好。

这套逻辑听起来挺美好,但它有一个几乎从没被明说的前提:老师和学生用的是同一套"字典"。

这里说的字典,专业叫法是**分词器**。

> 分词器(Tokenizer):模型不会直接"读"文字,而是先把文字切成一个个token(可以理解为模型能识别的最小语义单位),再转成数字送进模型。不同模型家族的分词器切法完全不同,比如同一句话,Qwen可能切成5个token,Gemma可能切成7个token,切分位置也对不上。

问题就出在这里。SU-01是Qwen家族出身,用它自己的分词器。而研究者想教的学生里,有Intern-S2、GLM-4.7、Gemma-4,这些模型各有各的分词器,跟老师完全不兼容。

这就好比你想让一个法语老师逐字批改一篇中文作文。老师看得懂这篇文章讲了什么,但他没法精确指出"这个字用得不好",因为他的语言里根本没有"字"这个切分单位,他只有"词组"。你如果强行让老师按自己的语言习惯去对齐学生的每一个汉字,要么对不上位置,要么干脆瞎对齐,教学效果可想而知。如果放弃这种逐字纠错,改成老师看完整篇作文打一个总分再让学生自己去猜哪里错了,那反馈的密度和精度都会大幅下降,这正是传统离线蒸馏的做法,而OPD的价值恰恰在于逐词纠错的精细度,一旦分词器不兼容,这个核心优势就没了。

除了字典对不上,还有第二个更隐蔽的麻烦:老师和学生的"体型"和"脑容量"差太多。

SU-01是能撑住10万token超长推理的重量级选手,而很多学生模型的上下文窗口要小得多。老师在教学生做题的时候,会不自觉地示范一种"写到天荒地老"的解题风格,而学生的"作业本"根本装不下这么多字。研究者观察到,直接做OPD训练之后,学生模型的输出长度会疯狂膨胀,而且经常写着写着就被截断了,句子说到一半戛然而止。

这就是论文标题里提到的四大难题:**分词器不匹配、师生分布错位、回答长度爆炸、训练不稳定**。四个问题环环相扣,解决起来不能head, 得系统性地拆解。

在"文字"这个共同的地基上对齐

研究者的解法,说穿了是一个很朴素的思路转向:既然token对不上,那就别在token这一层较劲了,退回到更底层、双方都认的东西,也就是文字本身。

具体流程是这样的。学生模型先用自己的分词器和对话模板生成一段回答,这段回答最终会被解码成一串普通的文字(就是我们人眼能读的那种句子)。这时候关键的一步来了:研究者不是把学生的对话上下文原样甩给老师去打分,而是重新用老师自己的对话模板包装一遍上下文,再把学生生成的这段文字拼接上去,交给老师用它自己的分词器重新切一遍。

这样一来,老师和学生手里各自有一份对同一段文字的切分方案,虽然切法可能不同,但底层的文字内容是完全一致的。研究者接下来做的,是一个**文本片段对齐**:只要老师切出来的某个token和学生切出来的某个token,覆盖的是完全相同的一段文字(起点和终点字符位置都对得上),就认为这两个token是"匹配"的,老师此时给出的打分才会用来指导学生。如果切分位置对不齐(比如老师把"苹果"切成一个token,学生把它切成"苹"和"果"两个token),那这部分就干脆放弃对齐,学生在这个位置继续用自己原本的打分,不受老师干扰。

这个过程用一个双指针扫描来实现:两边各自维护一个"目前已经读到哪里"的进度条,进度慢的一方往前挪一步,直到两边进度重新对齐,再看当前这一小段文字是否完全一致,一致就记为匹配,交给老师打分;不一致就都往前走,继续找下一个对齐点。

打个比方,这就像两个人分别用中文和英文给同一份合同做逐句批注,句子的分段方式完全不同(中文可能一句话对应英文的两句),但只要某一段中英文表达的是完全相同的一个条款,两边的批注就可以互相印证;如果分段对不上,那这一段就先不做交叉核对,各自按自己的理解走。如果非要强行按行号对齐两份文档的批注,很可能把第三条的意见错标到第五条上去,反而制造混乱。这里论文选择"宁可少对齐,不可乱对齐",本质上是在信噪比上做取舍:宁可损失一部分监督信号的覆盖率,也要保证剩下的信号是干净、可信的。

有意思的是,实测下来这种"宁缺毋滥"的对齐策略,覆盖率其实相当高。论文里给出的数据显示,即便是分词器差异很大的模型对之间,这个**词汇重叠率**(也就是学生生成的token里,有多少比例真正拿到了老师的打分)从训练一开始就能达到90%以上,训练几十步之后还能涨到97%到98%。这说明尽管两套分词器"语法"不同,但落到具体的数学、逻辑表达上,大部分常见词汇(比如"因为""所以""设""证明"这些高频词,还有具体的数学符号)的切分方式其实是趋同的,真正对不齐的往往是一些边角料。

当老师话太多,学生会疯

对齐问题解决了,但训练一开始跑起来,研究者立刻撞上了第二堵墙:训练不稳定,而且症状很戏剧化。

论文里记录了两个非常生动的案例。第一个案例是关于AIME25(一套数学竞赛测试)的一道题,学生模型其实已经算出了正确答案279,但接下来它开始不停地重复一句像强迫症一样的自我检查话术:"我会确保这个解答没有遗漏步骤""我会确保这个解答清晰""我会确保这个解答正确"……这段固定的十句话被原封不动地重复了整整972遍,一直写到16万token的生成上限被硬生生截断。

第二个案例更极端。模型在处理一道涉及"exotic integers"(论文里的自造术语,指满足特定整除关系的整数)的题目时,推理到一半卡在了一个关于乘法阶数的子问题上,然后彻底崩溃成一个单token死循环,疯狂输出"2的问号次方,2的问号次方,2的问号次方……"重复超过3万4千次,同样直到硬截断才停下。

这不是个例,是系统性的现象。研究团队画出了训练过程的曲线图,能清楚看到:随着训练步数增加,模型的截断率和重复率都在同步飙升,平均回答长度也跟着一路走高,从两万多token涨到八九万token。Qwen3.5-35B-A3B这个模型的情况尤其严重,性能一边涨一边跌,还伴随着持续攀升的截断率。

问题的根源不难理解。SU-01作为老师,本身就是那种能坚持写十万字推理才罢休的选手,它给学生打分的时候,天然会鼓励学生"再多写一点、再检查一遍、别急着结束"。可学生模型自己的原生风格未必是这样,它被这种持续的正向引导一步步带偏,越写越长,越写越啰嗦,最后连"我说完了"这个信号(也就是终止符)都不太会发了。

这就像一个原本习惯写500字周记的孩子,突然被安排跟着一位每天写一万字日志的作家学习。作家的每一句话都在示范"再多想一层、再补充一个角度",孩子如果全盘照搬这种节奏,却没有掌握作家那种收放自如的判断力,结果就是他会不停地往后加内容,加到最后连"全文完"三个字都忘了写,作文本写满了却还是一篇没写完的流水账。如果这时候放任不管,继续按老师的打分驱动训练,这种"越写越多、却越来越没内容"的趋势只会自我强化,最终把训练彻底带崩。

论文里点出了一个特别关键的技术细节:这个问题在两个特殊的**终止符**上表现得尤其明显。

两道"刹车":屏蔽终止符打分 + 拉住学生别跑太远

针对这个长度爆炸的问题,研究者试了两招,一招一招地加,效果也一招一招地验证。

第一招叫**特殊token屏蔽**。

这招上线后确实有效果,从图表上看,截断率的上升趋势被明显压制住了。但研究者很诚实地承认,这招不是万能药:训练到后期,截断率还是会重新往上爬,说明只堵住终止符这一个出口,堵不住整体越写越长的大趋势。

于是第二招登场,叫**学生参考KL损失**。

> KL散度(Kullback-Leibler Divergence):一种衡量两个概率分布"有多不像"的数学指标。这里说的"学生参考KL损失",是指额外增加一个约束项,强迫学生模型的当前策略不要离它自己训练前的原始策略太远,相当于给学生的"自由发挥"设了一道缰绳。

这个设计的思路是:既然问题根源在于老师的强势引导会把学生越拽越远,那就干脆给学生加一根"锚绳",把它跟自己最初的样子拴住,不管老师怎么示范,学生都不能偏离自己的"本色"太远。

效果立竿见影。论文里给出的数据非常清楚:加了这个约束之后,Intern-S2-Preview的截断率被压到了几乎为零,同时AIME25和AnswerBench这两个测试的分数还在稳步上涨。具体数字上,ProofBench从21.70分直接跳到38.50分,AnswerBench从76.03涨到79.10,AIME25从88.33涨到95.80。

这个"锚绳"设计其实揭示了一个更深的道理:好的模仿不是无条件的全盘接受,而是有边界的学习。

打个比方,你去跟一位大厨学做菜,大厨的手法确实高明,但如果你完全放弃自己已经养成的判断力,完全照搬大厨每一个细微的处理方式(包括他为了适应大厨房节奏而形成的某些习惯性动作),你反而会做出一道四不像的菜,因为你的厨房设备、食材份量、甚至味觉偏好都跟大厨不一样。真正有效的学习,是吸收大厨的核心判断逻辑,同时保留一根"回到自己基本功"的锚绳,不让自己在模仿中彻底走形。如果没有这根锚绳,你学到的可能只是大厨的表面动作,却丢了自己原本还算扎实的基本功。

把两招合并使用之后,效果达到了最佳状态。论文里给出的最终对比数据显示,Intern-S2-Preview经过完整的SimpleOPD训练后,ProofBench从21.70分提升到44.50分,涨了22.80分,几乎追平了老师SU-01的45.00分。AnswerBench从76.03涨到80.10,AIME25从88.33涨到95.00,两项都反超了老师。

数据说话:不同模型家族的成绩单

下面这张表格是论文里最核心的实验结果,涵盖了同家族和跨家族两种蒸馏场景。

| 模型 | ProofBench@4 | AnswerBench@8 | AIME25@8 | AMOBench@8 |

| SU-01(老师) | 45.00 | 77.50 | 94.60 | 61.75 |

| **同分词器场景** | | | | |

| Qwen3-4B | 11.42 | 47.50 | 71.25 | 23.00 |

| Qwen3-4B-OPD | **23.72** | **64.50** | **90.83** | **35.00** |

| Qwen3-30B-A3B | 13.80 | 59.13 | 88.33 | 36.50 |

| Qwen3-30B-A3B-OPD | **36.47** | **74.46** | **93.75** | **52.75** |

| **跨分词器场景** | | | | |

| Qwen3.5-4B | 15.90 | 60.94 | 86.67 | 32.00 |

| Qwen3.5-4B-OPD | **28.61** | **67.84** | **91.67** | **51.25** |

| Qwen3.5-35B-A3B | 26.78 | 73.16 | 94.60 | 57.25 |

| Qwen3.5-35B-A3B-OPD | **42.39** | **80.15** | **96.66** | **61.25** |

| Intern-S2-Preview | 21.70 | 76.03 | 88.33 | 58.00 |

| Intern-S2-OPD | **44.50** | **80.10** | **95.00** | **59.50** |

有个规律很明显:几乎所有模型经过SimpleOPD训练之后都实现了全面提升,而且提升幅度最大的板块永远是ProofBench,也就是那种需要自然语言写出完整证明过程的题目。这跟老师SU-01本身最擅长的领域正好对上号,说明老师最强的那部分能力,确实是被有效地传递过去了。

跨家族的场景(GLM-4.7-Flash和Gemma-4-26B-A4B)则更能说明分词器差异的实际影响。GLM-4.7在ProofBench和AnswerBench上都实现了稳定提升,从30.8涨到39.7、从69.6涨到72.0;而Gemma-4只在ProofBench上有明显提升(25.5到34.2),AnswerBench反而略微下降(68.8到67.5)。论文给出的解释是,GLM用的也是BPE分词器(跟SU-01的Qwen家族更接近),而Gemma用的是SentencePiece分词器,词汇表和切分逻辑差异更大,导致可对齐的部分相对更少。

还有一个让人挺惊喜的发现:这套方法带来的能力提升并没有局限在训练数据的范围内。训练数据全部是数学证明题,可是模型在HLE(人类终极考试)和HiPhO(高中物理奥赛)这类科学推理测试上也拿到了实打实的提升。

> HLE(Humanity's Last Exam):一套涵盖极其广泛学科、被认为逼近人类知识极限的高难度评测集,目的是检验AI在真正专家级问题上的表现。

> HiPhO:一套专门针对高中物理奥赛题目的评测基准,用来检测模型是否具备扎实的物理推理能力。

Intern-S2-OPD在HiPhO上从38.6涨到41.1,甚至超过了老师SU-01的35.0分。这说明蒸馏过程传递的不只是"怎么解某道数学题"这种表层技巧,而更像是一种底层的、可迁移的推理习惯,比如怎么拆解一个复杂问题、怎么一步步验证自己的逻辑。

数据配方也很讲究

论文还专门做了一个实验,看看训练数据的构成会不会影响效果。他们对比了"只用证明题数据"和"证明题加上SU-01训练时用过的可验证数学题"两种配方。

结果有点反直觉:加入更多可验证的数学题,并没有让整体表现变得更好,反而在ProofBench上出现了明显下降,从44.50掉到38.50,只有AnswerBench小幅上涨(80.10到81.10)。这说明如果目标是教会模型写出高质量的自然语言证明,那专注于证明类数据反而比"大杂烩"式的混合数据更有效,加入太多结构化、可自动判分的题目,反而可能稀释掉模型对自然语言论证风格的学习。

另外一个有意思的发现是关于**蒸馏长度**的。

> 蒸馏长度:指训练过程中允许模型生成回答的最大token数上限,比如6千token还是3.2万token。

论文对比了6k和32k两种设置,发现把上限从6k拉长到32k,几乎所有测试指标都会跟着提升,尤其是ProofBench提升最明显。这说明长篇幅的复杂证明确实需要更长的"呼吸空间",如果训练时就把学生的回答硬性压缩到很短,它是学不会那种层层递进、需要反复验证的多步骤证明写法的。

换个更大的老师会怎样

研究者还试过用DeepSeek-V4-Flash(一个参数量高达158B的更大模型)当老师,去教同一个Intern-S2-Preview学生,并且刻意只用了6k的短蒸馏长度以节省算力。

结果显示,即便蒸馏长度更短,这个更强的老师依然带来了扎实的提升:ProofBench从21.70涨到39.71,涨幅18.01分,比同样6k长度下用SU-01当老师的38.80分还要高出0.91分。这个细节挺关键,它说明老师本身的能力上限,会直接影响蒸馏效果的天花板,一个更强的老师即便"话没说那么多",依然能教出更好的学生。

写在后面

读完这篇论文,最让我意外的不是最终的分数提升,而是那两个训练崩溃的案例。一个模型算对了答案,却陷入了972遍一字不差的自我安慰式重复;另一个模型直接卡进了一个"2的问号次方"的死循环,重复三万四千次。这两个案例被完整地放进了论文附录,没有被美化或省略,这种坦诚挺难得的,也让人真切感受到"教AI学习"这件事,远不是调调参数那么简单,它更像是在跟一个具备一定自主性、但又极容易被带偏的系统博弈。

另一个让我反复琢磨的点是,特殊token屏蔽单独用效果有限,KL约束加进去之后才彻底解决问题,这个先后顺序本身就是一个很有价值的实验记录。它提示我们,很多看起来"对症"的补丁式修复,实际起作用的机制可能更表层,真正的病根往往需要一个更根本的约束机制才能兜住。

还有一个问题,论文里提到了但没有深挖:为什么用证明数据反而比加入更多可验证数学题效果更好?这背后是不是意味着,自然语言推理能力和"标准答案式"解题能力,其实是两种不完全重叠、甚至存在某种竞争关系的能力?如果真是这样,未来在设计训练数据配方的时候,恐怕不能简单地"越多越好",而要想清楚自己到底想要模型学会哪一种思维方式。

Q&A

Q1:SimpleOPD是什么?

A:SimpleOPD是一种跨分词器的在线策略蒸馏方法,通过在文字层面对齐老师和学生模型生成的相同文本片段,让不同家族、不同分词器的模型之间也能进行细粒度的推理能力迁移,同时用终止符屏蔽和学生参考KL损失来防止训练中出现回答长度爆炸和训练崩溃。

Q2:Intern-S2-Preview经过SimpleOPD训练后提升有多大?

A:在ProofBench测试上从21.70分提升到44.50分(用DeepSeek-V4-Flash评判则从34.0分涨到55.2分),涨幅超过20分,同时在AnswerBench、AIME25、AMOBench等测试上也全面超越了原始模型,部分指标甚至反超了老师模型SU-01。

Q3:为什么直接做OPD训练会导致模型崩溃?

A:因为老师模型SU-01习惯写超长推理过程,它在打分时会持续鼓励学生模型"多写、别停",学生模型如果全盘接受这种引导,就会出现回答长度不断膨胀、频繁被截断、甚至陷入重复循环的问题,论文通过屏蔽终止符的打分影响并加入约束学生偏离原始策略的KL损失来解决这个问题。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
宇树IPO:追高、被套,多久能回血?

宇树IPO:追高、被套,多久能回血?

36氪财经
2026-08-24 15:24:18
河南一玛莎拉蒂凌晨撞破护栏坠河,车上3人已被捞起

河南一玛莎拉蒂凌晨撞破护栏坠河,车上3人已被捞起

映射生活的身影
2026-08-23 22:38:47
“丑牛”48小时攻陷全球!美联社、彭博社抢破头,日本牛片都出了

“丑牛”48小时攻陷全球!美联社、彭博社抢破头,日本牛片都出了

锅锅爱历史
2026-08-22 14:44:09
4名内地男子到澳门招嫖,白嫖后还让5个女子付钱给他们,有2个女子拒绝给钱,将他们举报了

4名内地男子到澳门招嫖,白嫖后还让5个女子付钱给他们,有2个女子拒绝给钱,将他们举报了

汉史趣闻
2026-08-23 08:53:46
4000米跑道剩91米才拉升!越航787爆4胎,287人全部平安

4000米跑道剩91米才拉升!越航787爆4胎,287人全部平安

航空之家Aviation
2026-08-24 08:57:04
王毅离韩当天,朝鲜连发10枚导弹示威,想见金正恩的特朗普该懂了

王毅离韩当天,朝鲜连发10枚导弹示威,想见金正恩的特朗普该懂了

谛听骨语本尊
2026-08-23 21:45:35
坏了!18号台风沙德尔锁定我国,27日登陆福建,江浙沪能松口气?

坏了!18号台风沙德尔锁定我国,27日登陆福建,江浙沪能松口气?

老牛讲
2026-08-24 12:57:52
朝鲜冷门炮大规模入俄,射速落后时代,却成乌军最头疼的远程杀器

朝鲜冷门炮大规模入俄,射速落后时代,却成乌军最头疼的远程杀器

军情观察家
2026-08-24 16:40:18
超8亿元封板!002015,一字涨停!

超8亿元封板!002015,一字涨停!

证券时报
2026-08-24 11:03:15
“台湾节目嘉宾说北京没有冰箱引群嘲”热搜第一,网友评论:这种人是活在上世纪吗?

“台湾节目嘉宾说北京没有冰箱引群嘲”热搜第一,网友评论:这种人是活在上世纪吗?

中国日报
2026-08-23 10:32:52
中央气象台:台风“沙德尔”将于27日至28日登陆闽浙沿海

中央气象台:台风“沙德尔”将于27日至28日登陆闽浙沿海

新京报
2026-08-24 17:03:14
寸步不让!中方明确告知李在明:代表团想来北京,这两人得踢出去

寸步不让!中方明确告知李在明:代表团想来北京,这两人得踢出去

铁锤侃侃而谈
2026-08-23 15:17:10
骂完张丹丹就散了?3.2亿灵活就业者的四个真问题,一个都没解决

骂完张丹丹就散了?3.2亿灵活就业者的四个真问题,一个都没解决

冷观互联网
2026-08-23 11:58:11
孙骁骁家底有多厚?重庆独生女坐拥顶级资源,为何偏偏嫁给任重回老家吃路边摊?

孙骁骁家底有多厚?重庆独生女坐拥顶级资源,为何偏偏嫁给任重回老家吃路边摊?

乡野小珥
2026-08-24 09:21:56
想不到!离婚3年的浪子前夫,竟给47岁未再嫁的章子怡留一手好牌

想不到!离婚3年的浪子前夫,竟给47岁未再嫁的章子怡留一手好牌

秋风悲画芯
2026-08-24 05:09:35
太夸张了!中本贯通一次性缴费69080元,一年花10万,一张2026级新生缴费截图,引发热议

太夸张了!中本贯通一次性缴费69080元,一年花10万,一张2026级新生缴费截图,引发热议

火山詩话
2026-08-24 08:59:45
用嘴舔勺子、穿衣暴露在人前晃,没分寸感的她来《中餐厅》干嘛?

用嘴舔勺子、穿衣暴露在人前晃,没分寸感的她来《中餐厅》干嘛?

寒士之言本尊
2026-08-22 23:08:24
2016年,易建联花重金在洛杉矶买下的豪宅,如今出售值多少钱?

2016年,易建联花重金在洛杉矶买下的豪宅,如今出售值多少钱?

老娱记啊
2026-08-24 15:58:24
上海市杨浦区区长周海鹰,拟任新职!曾林峰,任北京市西城区代区长!

上海市杨浦区区长周海鹰,拟任新职!曾林峰,任北京市西城区代区长!

一口娱乐
2026-08-24 11:36:09
日语正在“自杀”:日本人已经渐渐看不懂自己的语言了

日语正在“自杀”:日本人已经渐渐看不懂自己的语言了

爱下厨的阿椅
2026-08-20 08:09:02
2026-08-24 20:12:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9626文章数 568关注度
往期回顾 全部

教育要闻

数学规律这样找,二年级也能轻松掌握!

头条要闻

新加坡总理用中文演讲:新加坡绝不能成为单语社会

头条要闻

新加坡总理用中文演讲:新加坡绝不能成为单语社会

体育要闻

42张照片 珍藏世界杯的热辣滚烫

娱乐要闻

韩沛颖开撕《主角》剧组引发全网热议

财经要闻

宇树IPO:追高、被套,多久能回血?

科技要闻

宇树科技,3天跌了1000亿

汽车要闻

智能超混 国民家轿 上汽大众ID. ERA 5S上市 限时8.99万元起

态度原创

艺术
时尚
手机
家居
军事航空

艺术要闻

“苏联的塞尚”——彼得·康查洛夫斯基

夏天别总穿白色T恤,试试这几款衬衫,配裤子裙子都显气质

手机要闻

vivo公布OriginOS 7新功能:能在桌面、壁纸、熄屏界面上贴纸

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

美国与以色列发生“罕见冲突”

无障碍浏览 进入关怀版