网易首页 > 网易号 > 正文 申请入驻

NAVER AI实验室发现:让AI数学家"同时说多国语言"的秘密武器

0
分享至


这项由韩国NAVER AI实验室完成的研究以预印本形式发布于2026年8月6日的arXiv平台,论文编号为arXiv:2608.05802,题为《On-Policy Delta Distillation for Multilingual Math Reasoning》。对该领域感兴趣的读者可通过上述编号查阅完整原文。

如果你曾经用中文问过一个AI助手一道数学题,却发现它用英语回答你,那你大概能感受到这项研究试图解决的核心痛点。人工智能在做数学题这件事上越来越厉害,但它"说人话"——尤其是说非英语的人话——依然是一个被严重忽视的问题。NAVER AI实验室的研究者们把目光投向了韩语和日语这两种东亚语言,试图搞清楚一个关键问题:有没有办法让AI在数学推理能力变强的同时,也能用你提问时用的语言来回答你?

这个问题看起来简单,背后却牵扯着AI训练领域一场正在发生的技术变革。

一、AI学数学,靠的是什么"老师"?

在理解这项研究的核心之前,我们得先弄清楚AI是怎么"学会"做数学的,或者说,它是怎么从一个只会复读机式背诵的工具,进化成能真正推理解题的助手的。

传统上,AI学做数学靠的是一种叫做"强化学习"的方法。可以把它理解成这样一个场景:老师给学生出了一道题,学生写完整个解答过程后,老师只看最终答案,然后说"对"或者"错",给出一个总评分。这种方式虽然有效,但有一个显而易见的缺陷——学生做了很多步骤,老师只评价了最后一步,中间到底哪里做对了、哪里做错了,完全不知道。这种"一锤子买卖"式的反馈,导致训练效率低下,AI需要做大量的题才能有明显进步。

于是,研究者们开始探索一种更精细的替代方案,叫做"在策略蒸馏",英文缩写是OPD(On-Policy Distillation)。这个名字听起来很复杂,但背后的逻辑其实相当直观。换一个场景来理解:一位经验丰富的数学老师(我们叫他"师傅")和一位正在学习中的学生坐在一起。学生先自己做一道题,写下整个解题过程。然后,师傅对着学生写的每一步逐字审阅,在每个关键节点上给出反馈:"这一步你选了这个词,我会选那个词,因为……"这种逐词逐句的细致指导,显然比最后只给一个总分要有效得多。

在OPD框架下,AI学生自己先生成一段解答,然后把这段解答送给"师傅模型"(一个更强大、已经经过充分训练的AI),师傅会对学生生成的每一个词打一个分数——这个词是否符合师傅自己的偏好。学生模型则根据这些逐词的分数来调整自己的行为,让自己未来的输出越来越接近师傅的水平。这种机制的精妙之处在于,它提供的是"词元级别"(token-level)的监督信号,远比强化学习那种"序列级别"(sequence-level)的笼统评分精细得多。

二、从"模仿师傅"到"学习师傅的成长"

OPD已经很好用了,但研究团队在这个基础上进了一步,提出了一个名为OPD?(On-Policy Delta Distillation,在策略增量蒸馏)的改进版本。这个改进的关键,在于一个颇具哲学意味的转变:与其让学生去模仿师傅现在的样子,不如让学生去学习师傅究竟"成长了什么"。

具体来说,任何一个强大的AI师傅,在成为"师傅"之前,都经历过两个阶段:第一阶段是大规模的基础训练,产生一个"基础模型",这个基础模型已经掌握了大量语言知识,但还不太会深度推理;第二阶段是专项的"后训练",通过强化学习等手段,让基础模型蜕变成擅长数学推理的师傅模型。OPD?的核心思路是:把师傅模型在每个词上的打分,减去基础模型在同一个词上的打分,得到一个"差值"——这个差值代表的就是后训练阶段为师傅带来的纯粹的推理能力增量。

用一个更生动的类比来说:假设你想学烹饪,你可以模仿一位大厨做的整道菜(普通OPD的思路),也可以专门学习大厨在成为大厨之前和成为大厨之后,他的做法究竟发生了哪些具体变化——哪些步骤是新加的、哪些手法是精进的(OPD?的思路)。后者让你学到的,是更纯粹、更精华的"功夫进阶秘诀",而不会被大厨一直以来的个人习惯和风格所干扰。

这个"差值信号"被研究者称为"delta信号",它的目的是过滤掉师傅模型中那些来自基础训练阶段就已存在的、与推理能力无关的语言偏好和风格倾向,只保留后训练过程中真正习得的推理能力精华。此前,OPD?在英语的数学、科学和编程推理任务上已经证明了自己比普通OPD更胜一筹。而这项研究要解答的,是同样的优势能否延伸到韩语和日语这样的非英语世界。

三、实验室里的"多语言数学考场"

为了回答这个问题,研究团队搭建了一个颇具规模的实验环境。他们构建了一个包含十万道数学题的训练数据集,英语、韩语和日语各占三分之一,彼此之间没有重叠题目。韩语和日语题目从NVIDIA发布的一个多语言数学数据集中抽取,英语题目则来自另一个专门的英语数学数据集。除了这套混合语言数据集,他们还单独准备了一套纯英语的十万道题,用于后续的对比实验。

学生模型选用了Qwen3家族中的两个版本:参数量较小的Qwen3-1.7B和参数量较大的Qwen3-8B——这两个数字大体上可以理解为模型的"脑容量"大小。师傅模型则是更强大的Qwen3-30B-A3B-2507。所有模型都在"思考模式"(thinking mode,类似于让AI在回答前先列出推理过程)和"非思考模式"(non-thinking mode,直接给出答案)两种状态下分别训练和评测。

评测所用的基准测试覆盖多个维度:PolyMath是一个专门评测多语言数学推理的基准;Global-MGSM是另一个多语言数学测试;HRM8K则是包含GSM8K、MATH、Omni、KSM、M-MMLU五个子集的韩语为主的综合测试;日语方面还额外使用了MAWPS基准。

四、韩语和日语的"成绩单"

实验结果相当清晰。先看非思考模式下的核心数据——研究者用PolyMath和Global-MGSM两个基准的平均分来呈现整体趋势。

对于较小的Qwen3-1.7B模型,基础版本(未经任何OPD训练)在英语上的平均分是55.1,在韩语上是40.9,在日语上是37.2。经过普通OPD训练后,这三个数字分别提升到61.5、48.8和48.0。而经过OPD?训练后,进一步提升到63.6、51.9和52.0。这意味着OPD?在韩语上比普通OPD高出3.1分,在日语上高出4.0分,在英语上高出2.1分——非英语语言的进步幅度反而更大。

对于较大的Qwen3-8B模型,同样的规律继续成立。基础版本的英语、韩语、日语平均分分别是62.8、57.0和57.1。OPD训练后变为69.8、61.1和61.9。OPD?训练后达到70.5、64.4和65.0。OPD?相对OPD在韩语和日语上分别多出3.3分和3.1分,在英语上只多出0.7分。

从完整的基准测试数据来看,OPD?在Qwen3-1.7B上将非思考模式下英语平均分从47.6拉升到65.7,韩语从37.4拉升到56.5,日语从55.5拉升到65.4。在思考模式下,由于基础模型本身已有相当强的推理能力,提升幅度相对较小,但OPD?依然将英语平均分从70.4提升到73.4,韩语从63.7提升到68.2,日语从68.5提升到71.2,而普通OPD的对应成绩分别是71.4、66.2和70.5——OPD?的优势依然稳定存在。

对于更大的Qwen3-8B,非思考模式下OPD?将英语平均分从58.7提升到75.3,韩语从55.4提升到72.2,日语从70.2提升到75.2。在思考模式下,普通OPD出现了一个耐人寻味的现象:它的英语平均分从80.9反而下降到79.9,韩语从78.0下降到75.7——也就是说,对于本身已经很强的模型,普通OPD的训练信号反而可能帮倒忙。OPD?则没有这个问题,它将英语推至83.2,韩语推至80.4,日语推至78.9,全面超越基础模型。

五、英语和韩语之间的"成绩差距"能缩小吗?

研究者还专门观察了一个现实中颇为突出的现象:AI在处理英语数学题时,普遍比处理韩语数学题表现更好,这种系统性的差距究竟有多大,又能通过OPD训练缩小多少?

以Qwen3-1.7B在思考模式下的数据为例,基础模型在各个基准上的英韩差距触目惊心:PolyMath上差6.4分,Global-MGSM上差13.4分,HRM8K的GSM8K子集上差12.1分。经过普通OPD训练后,这些差距有所收窄:PolyMath降到4.4分,Global-MGSM降到8.6分,KSM子集上的差距从3.3分大幅缩小到仅0.4分。但OPD的效果并不稳定,M-MMLU子集上的差距反而从1.1分扩大到了4.6分。

OPD?的表现更为一致。它将PolyMath上的差距压缩到5.0分,Global-MGSM上压缩到9.3分,HRM8K-GSM8K差距从12.1分降至9.2分。MATH、Omni、KSM三个子集的差距也全部收窄,而M-MMLU上的差距保持在1.1分不变。归根结底,在七个报告的基准中,OPD?在六个上缩小了英韩差距,在剩余一个上维持了现状——没有一个出现恶化。这说明多语言联合训练往往对韩语推理能力的提升幅度更大,因此在不损害英语表现的前提下,实际上拉近了两种语言之间的能力鸿沟。

六、"只学英语"能走多远?

整个研究中最出乎意料的发现,来自一组对比实验:如果把多语言训练数据换成纯英语数据,韩语和日语的表现会发生什么?

答案令人惊讶:纯英语训练的OPD?,居然也能大幅提升韩语和日语的数学推理成绩。在非思考模式下,英语专训的OPD?将韩语平均分从37.4提升到59.3,将日语平均分从55.5提升到66.5。这两个数字不仅远高于基础模型,甚至在有些情况下还略高于多语言训练版本(多语言OPD?的对应成绩分别是56.5和65.4)。在思考模式下,英语专训OPD?将韩语平均分提升到65.1,日语提升到69.9,多语言训练版本则达到68.2和71.2——多语言版本整体略优,但英语专训版本依然相当接近。

这个发现在直觉上有些违反常识:明明没有看过任何韩语或日语训练题,AI的韩语和日语数学能力怎么还提升了?研究者认为,这背后的逻辑是:数学推理本身是一种语言无关的抽象能力,当AI通过英语题目练就了更强的逻辑推理能力之后,这种能力在面对非英语输入时也能被调用,产生迁移效应。

然而,这里藏着一个关键的陷阱。

七、测试分高不等于"说对语言"

仅仅看测试分数,会产生一种虚假的乐观。研究团队做了一项补充调查:当AI用韩语或日语被提问时,它究竟用什么语言来回答?

结果揭示了纯英语训练的真实代价。在非思考模式下,多语言训练的OPD?,给出韩语回答的比例高达90.5%,给出日语回答的比例高达90.9%——也就是说,九成以上的时间里,模型能用提问语言来作答。而英语专训的OPD?,这两个数字分别骤降到48.3%和29.6%——超过一半的韩语问题和超过七成的日语问题,模型选择用英语来回答,尽管题目是韩语或日语写的。

思考模式下(只统计最终答案部分,不含中间推理过程,因为思考过程本来就主要用英语),多语言OPD?的韩语目标语言回答率是97.6%,日语是95.2%。英语专训OPD?则分别跌到36.1%和30.8%。

普通OPD的情况也值得单独关注。在思考模式下,英语专训的普通OPD,韩语目标语言率是83.1%,看起来还不错;但日语仅有36.9%。多语言训练的普通OPD,韩语是72.9%,日语是70.1%——多语言训练同样改善了语言保持能力,但幅度不如OPD?明显。非思考模式下,多语言普通OPD的韩语目标语言率达到99.7%,日语达到99.8%,几乎完美;英语专训普通OPD的韩语是83.6%,日语是40.5%。

这组数据清晰地揭示了一个重要区分:数学推理能力可以跨语言迁移,但"用对语言回答"这件事,是需要专门训练的。一个AI可以"读懂"韩语题并在内心用英语把它做出来,然后用英语把答案说出来——这在基准测试上可能得分不错,但对于真实用户来说,这是一种令人沮丧的体验。多语言训练数据的存在,是保证模型不仅"能做"而且"会用对语言做"的关键。

归根结底,这项研究的发现可以用一句话来概括:OPD?是一种比普通OPD更有效、更稳定的AI数学训练方式,它在韩语和日语上的提升幅度甚至超过英语;英语数据训练出的推理能力确实能跨语言传播,但如果你真正在意AI能不能用你的语言跟你交流,多语言的训练数据就不是可有可无的选项,而是不可或缺的基础。这对未来开发面向多语言用户群体的AI系统,是一个务实且重要的参考信号。

想深入了解技术细节的读者,可通过arXiv编号2608.05802查阅NAVER AI实验室的完整论文,研究使用的OPD?代码也已开源。

Q&A

Q1:OPD?和普通OPD有什么区别?

A:普通OPD让AI学生去模仿师傅模型的输出分布,而OPD?改为利用"师傅模型"和"师傅的基础版本"之间的概率差值作为训练信号,专门提取师傅在后训练阶段习得的推理能力精华,过滤掉基础语言偏好的干扰。实验结果显示这个简单修改带来了稳定且显著的性能提升。

Q2:只用英语数据训练AI,为什么韩语和日语数学成绩也会变好?

A:数学推理是一种抽象逻辑能力,和具体语言有一定程度的解耦。AI通过英语题目强化了推理能力后,这种能力在面对其他语言的数学题时也能被调用,产生跨语言迁移效应。但这种迁移只影响"做题能力",不影响模型用哪种语言回答,所以英语专训的AI经常用英语回答韩语或日语问题。

Q3:多语言OPD训练会不会损害英语的数学推理能力?

A:根据实验结果,不会。多语言OPD?在英语基准上的表现与纯英语训练的OPD?相当甚至更好,同时还显著提升了韩语和日语的推理能力,并有效保持了模型用目标语言回答的能力。总体来看是一种各方面损耗都很小的联合提升方案。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中日意见达成一致,高市终于做对了,台当局自不量力,丢脸丢大了

中日意见达成一致,高市终于做对了,台当局自不量力,丢脸丢大了

闻识
2026-08-13 00:36:43
时隔5年再夺1000赛冠军!张帅组合横扫3号种子,斩获赛季第4冠

时隔5年再夺1000赛冠军!张帅组合横扫3号种子,斩获赛季第4冠

全景体育V
2026-08-14 06:02:51
美股收盘:三大指数齐升标普收新高 存储板块走强闪迪涨逾13%

美股收盘:三大指数齐升标普收新高 存储板块走强闪迪涨逾13%

财联社
2026-08-14 06:25:05
杜兰特长文致敬威少:整整18年,他用行动激励了所有人

杜兰特长文致敬威少:整整18年,他用行动激励了所有人

懂球帝
2026-08-14 07:15:04
篡改红歌已立案,郭德纲一觉醒来大祸临头,事做太绝了杨议没说错

篡改红歌已立案,郭德纲一觉醒来大祸临头,事做太绝了杨议没说错

龙隐天下
2026-08-13 14:36:13
60后男子与离异女同居,多次跟她13岁女儿发生关系,女孩未反抗竟让他更猖狂,法院的判决结果令人震惊!

60后男子与离异女同居,多次跟她13岁女儿发生关系,女孩未反抗竟让他更猖狂,法院的判决结果令人震惊!

一丝不苟的法律人
2026-08-13 17:33:25
看完《龙餐馆》后,我最大的请求是:若沈腾拿不了影帝,也必须给蒋奇明一个最佳男配!

看完《龙餐馆》后,我最大的请求是:若沈腾拿不了影帝,也必须给蒋奇明一个最佳男配!

娱乐故事
2026-08-12 22:28:02
终于明白了:张良垴就是殉情的地方!难怪程梦圆没能从这里走出去

终于明白了:张良垴就是殉情的地方!难怪程梦圆没能从这里走出去

小鹿姐姐情感说
2026-08-14 05:16:19
俄乌鏖战正酣 普京为何此时向东“亮剑”?

俄乌鏖战正酣 普京为何此时向东“亮剑”?

看看新闻Knews
2026-08-13 23:07:47
裁判出面劝双方冷静!中国公开赛宾汉姆与瓦菲爆发争议犯规风波

裁判出面劝双方冷静!中国公开赛宾汉姆与瓦菲爆发争议犯规风波

江启
2026-08-14 00:27:21
“数学天才”柳智宇转身这16年:很满意现在的生活状态,若坚持走数学这条路也不太可能成为邓煜或王虹

“数学天才”柳智宇转身这16年:很满意现在的生活状态,若坚持走数学这条路也不太可能成为邓煜或王虹

极目新闻
2026-08-13 19:04:08
弟弟举报哥哥冒用自己身份上大学,最新发声:从来没有想过报复哥哥,也没有针对他,有想过如果举报会毁了他,但先救自己的心更强烈

弟弟举报哥哥冒用自己身份上大学,最新发声:从来没有想过报复哥哥,也没有针对他,有想过如果举报会毁了他,但先救自己的心更强烈

大风新闻
2026-08-13 15:00:10
10秒10赛季最佳!全国田径锦标赛:谢震业百米飞人大战强势夺冠

10秒10赛季最佳!全国田径锦标赛:谢震业百米飞人大战强势夺冠

全景体育V
2026-08-13 21:06:21
随着韦克林4-6,斯诺克中国公开赛8强诞生:仅2位中国选手晋级

随着韦克林4-6,斯诺克中国公开赛8强诞生:仅2位中国选手晋级

侧身凌空斩
2026-08-13 23:57:20
邹市明45岁重返拳击赛场!坦言:听老婆的话,重返拳台并非单纯为了还债,冉莹颖:“打赢了有钱花,打输了大不了换老公,还有保险拿”

邹市明45岁重返拳击赛场!坦言:听老婆的话,重返拳台并非单纯为了还债,冉莹颖:“打赢了有钱花,打输了大不了换老公,还有保险拿”

都市快报橙柿互动
2026-08-13 18:20:10
顾客订酒店实付221元,商家到手仅40.67元,“超八成被平台扣走”;平台客服:活动需商家主动参与

顾客订酒店实付221元,商家到手仅40.67元,“超八成被平台扣走”;平台客服:活动需商家主动参与

大风新闻
2026-08-13 19:55:14
“二鬼子”还来劲了,但更危险的还在后面

“二鬼子”还来劲了,但更危险的还在后面

补壹刀
2026-08-13 18:29:10
长沙偶遇李小冉,本人没网上吹的那么年轻漂亮,虽然很白但显老态

长沙偶遇李小冉,本人没网上吹的那么年轻漂亮,虽然很白但显老态

手工制作阿歼
2026-08-14 02:13:32
全网封杀!重庆老板恶意碰瓷伊犁民宿,藏区同行集体避雷

全网封杀!重庆老板恶意碰瓷伊犁民宿,藏区同行集体避雷

林子说事
2026-08-14 00:44:36
一套房8000元!又一个鹤岗,诞生了?

一套房8000元!又一个鹤岗,诞生了?

西部城市
2026-08-13 17:43:47
2026-08-14 08:04:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9516文章数 568关注度
往期回顾 全部

科技要闻

一切皆插件!DeepSeek Harness正式发布

头条要闻

普京罕见穿军装亲自坐镇指挥军演 日本反应极其激烈

头条要闻

普京罕见穿军装亲自坐镇指挥军演 日本反应极其激烈

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

全新红旗H7到底新在哪儿?

态度原创

艺术
游戏
家居
本地
公开课

艺术要闻

顶级的大片

《喵喵的结合》简体中文翻译开启公测 迟来的惊喜!

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

黄州一夜,苏轼写给普通人的月光

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版