网易首页 > 网易号 > 正文 申请入驻

让AI模型学会"看语言脸色":一个专治多语言偏科的数据生成新方法

0
分享至


你有没有想过,同一个AI模型,用中文问它和用英文问它,可能会得到完全不同质量的答案?

这不是错觉。2024年有研究团队做了个实验,让Qwen2.5这个大模型回答同一批多语言阅读理解题目,结果发现:用英文提问,正确率能到84.3%;换成阿拉伯语提问,同样的题目,正确率直接掉到63.6%。整整21个百分点的差距,意味着什么?意味着每5道题里,用阿拉伯语提问就要比用英文提问多错1道。

这个现象有个学名,叫语言特定能力差异(Language-Specific Competency,简称LSC,指同一个语言模型对语义相同的问题,用不同语言提问会给出不同甚至错误答案的现象)。听起来有点抽象,但换个说法你就懂了:这就好像一个双语翻译,用母语聊天时思路清晰、旁征博引,可一旦切换到第二语言,同样的话题却开始磕磕巴巴、丢三落四。语言没变意思,但表达质量断崖式下跌。

这篇来自UIUC和Uniphore团队的论文,就是想解决这个让人头疼的问题。他们提出了一个叫HOTFIXR的方法,试图找到一条中间道路,既不让模型变成"英语脑袋",也不让它在追求语言公平的过程中变得平庸。

为什么会有这种偏科现象

要理解这个问题的根源,得先说说大模型是怎么"思考"的。

现在主流的大语言模型,训练数据里英文占了绝大多数。这就导致一个有趣的副作用:模型在处理非英文文本时,会先在内部把这些内容"翻译"成英文式的思维过程,理解完了再翻译回目标语言输出。有研究者专门去看过模型内部的信息流动,发现在处理多语言输入时,模型确实在中间层大量地"绕道"英语空间,思考完之后再绕回目标语言的表达空间。

这就带来一个很关键的后果:英语几乎成了模型能力的天花板。凡是能用英语说清楚的概念,模型答对的概率就高;而那些在英语里没有直接对应说法的概念,或者英语语料里本来就覆盖不足的知识,模型用其他语言问出来时,答案质量就会打折。

这里要引入一个概念,表征错位(representational misalignment,指模型对同一个语义概念,在不同语言中形成了不一致的内部表示)。

论文里提到这种错位主要表现为三种情况:一是语言特定知识差异,同一个事实性问题用不同语言问,模型给出的答案可能不一样;二是非同构性(non-isomorphism,指某些词语或短语在不同语言之间没有直接对应的翻译),比如中文里的"缘分"很难找到一个英文单词完全对应;三是非组合性(non-compositionality,指一个短语的整体含义无法从组成它的单个词汇推导出来),最典型的例子就是成语和惯用语,字面翻译往往面目全非。

那有没有可能直接用"打平"数据分布的办法解决问题?还真有团队试过。Cohere公司训练了一个叫Aya-23的模型,特意在预训练阶段把23种语言的数据尽量平衡。结果确实很有意思:在前面提到的多语言阅读理解测试里,Aya-23在不同语言之间的表现变得相当一致,阿拉伯语和英语的差距明显缩小了。但代价也很明显,它在英语上的绝对表现,反而不如那个"偏科"的Qwen2.5——Qwen在英语上能到84.3%,Aya-23只有70.6%。

这其实呼应了一个更早的发现,语言学界把这个现象叫作"多语言的诅咒"(Curse of Multilinguality,指随着预训练数据中语言种类的增多,模型在单一语言上的整体表现会趋于停滞甚至下降的规律)。

这就形成了一个两难局面:要么你把资源全押在英语上,牺牲其他语言的表现;要么你追求语言间的公平,但代价是整体能力被拉低到一个中庸水平。这种取舍就好像一个班主任分配辅导时间,如果把所有精力都投给数学最好的那几个学生,班级数学平均分会很漂亮,但偏科生永远补不上;如果非要把时间平均分给每个学生,整体平均分反而会被拖累,因为原本可以冲得更高的尖子生没有得到足够的资源。这篇论文想问的是,有没有第三条路,能不能找到一种更聪明的辅导方式,既不放弃尖子生的潜力,也能把偏科生的短板补上,而不是简单地平均分配时间。

HOTFIXR到底是怎么运作的

论文提出的方法叫HOTFIXR,全称是Hardness Optimized Training-data For Improving X-lingual Reasoning(难度优化的训练数据生成框架,用于提升跨语言推理能力)。

这个名字听起来挺学术,但核心思路其实很直白:不要瞎猜模型哪里弱,而是让模型自己"暴露"弱点,然后针对性地生成练习题去补。

具体是怎么做到的?这里要先解释一个概念,acquisition function(获取函数,原本是数据选择和主动学习领域的术语,指一种评分标准,用来判断某个数据样本对训练是否有价值)。

在HOTFIXR里,研究团队设计了一个叫"语言缺陷分数"(Lingual Deficit Score)的指标,专门用来衡量一道题目对模型的多语言能力来说有多"难啃"。这个分数由两部分组成。

第一部分叫语言无关的能力不足(Language-Agnostic Incompetency,简称LAI,指模型无论用哪种语言回答,都表现出的不确定性)。具体做法是,让模型用它最擅长的语言(通常假设是英语)去推理一道题,然后看模型在生成答案的过程中,每一步选词时有多"犹豫"。如果模型对下一个词该选什么都拿不准,那说明这道题本身就超出了模型的能力边界,不管换哪种语言都可能答错。

第二部分叫语言特定的能力不足(Language-Specific Incompetency,简称LSI,指模型在用不同语言推理同一道题时,内部表征出现的偏移程度)。做法是让模型分别用英语和另一种语言(比如西班牙语)去推理同一道题,然后抓取模型在做出最终回答前那一刻的内部隐藏状态,计算两次推理隐藏状态之间的"距离"。如果这个距离很大,说明模型在用不同语言思考同一件事时,脑子里想的其实不是一回事,这就是表征错位在起作用。

这两个分数加起来,就是一道题目的综合"缺陷分数"。分数越高,说明这道题越能戳中模型的多语言软肋,也就越值得拿来训练。

那这些题目从哪来?这里就要提到整个流程里最巧妙的一环了。研究团队训练了一个专门的题目生成模型,让它根据学生模型(也就是需要被改进的目标模型)反馈的缺陷分数,不断调整自己生成题目的策略。这个优化过程用的是GRPO算法(Group Relative Policy Optimization,一种强化学习优化方法,最早在DeepSeekMath论文中被提出用于提升数学推理能力)。

说得更形象一点,这就像是请了一位家教,但这位家教一开始并不知道学生哪里薄弱。传统的做法是家教自己出一套通用卷子给学生做,做完批改,看看哪里错得多。但HOTFIXR的做法更进一步,这位家教会不断出题、观察学生的反应(犹豫、内部思路混乱的程度),然后根据反应调整下一次出题的方向,专挑那些让学生最纠结、最容易在不同语言间"打岔"的题型。如果不这样做,让家教随便出题会怎样?论文里的对照实验其实回答了这个问题,那些用未经训练的模型随机生成题目的方法(论文里叫Untrained基线),效果明显不如经过针对性优化的HOTFIXR,在跨领域任务上平均只领先基线1.4个百分点,而HOTFIXR能领先5.6个百分点。

值得一提的是,研究团队在训练这个"出题家教"模型时只用了500道种子题目,看起来数量很少。但这是有意为之的,他们发现如果给的种子题目太多,出题模型会出现reward hacking(奖励作弊,指模型找到了一个能拿高分但没有实际训练价值的"捷径",然后反复利用这个捷径而不再探索)的问题。具体表现是,出题模型会找到一道让缺陷分数特别高的题目,然后不管怎么换提示词,都反复生成几乎一样的题目。这就好比考试作弊被抓的学生发现了一道题的答案能蒙对,之后每次都写同一个答案,完全不再思考新题目。为了避免这种情况,研究团队把强化学习的优化步数控制在40步左右,种子数据也压缩到500条,这样既能让模型学到有效的出题策略,又不至于让它"偷懒"钻牛角尖。

生成出来的高质量题目,还需要标准答案。研究团队用了一个更大的模型Qwen2.5-32B-Instruct来给这些新生成的题目打标准答案,因为他们在预实验里发现,如果让被训练的学生模型自己给自己出的题打分,标签质量会很差,模型经常连"请用指定语言回答"这种基本指令都执行不好。这也算是一个诚实的局限性披露,整个流程还是依赖一个足够强的外部模型来兜底答案质量。

效果到底怎么样

光说方法巧妙没用,得看数据说话。

论文在三个模型上做了测试:Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct,以及Meta的Llama-3.1-8B-Instruct。测试任务分成两大类,一类是训练数据覆盖到的领域内任务(Nemotron数据集的STEM、数学、对话三个子集),另一类是训练时没见过的领域外任务,包括事实性知识问答(MMMLU)、多语言检索增强问答(mHotPotQA)、以及翻译任务(OPUS-100)。语言方面,训练用的六种语言是英语、法语、西班牙语、阿拉伯语、葡萄牙语、意大利语,另外还专门留了德语和日语作为完全没见过的语言,用来检验模型是不是真的学到了普适的多语言能力,而不是只在训练语言上刷分。

先看领域内的表现。HOTFIXR相比基础模型(也就是完全没做任何微调的原始模型)平均提升了6.2个百分点。相比其他数据生成和数据选择的基线方法(比如直接用现成数据训练、用未经优化的模型出题、或者DataEnvGym这种不区分语言的通用数据生成方法),HOTFIXR的优势更明显,平均领先6.0到7.3个百分点不等。

再看领域外任务。这里的核心矛盾在于,大部分微调方法为了让模型在特定任务上变强,往往会牺牲模型在其他任务上的表现,这个现象业内叫"灾难性遗忘"。论文里给出的数据显示,HOTFIXR相比基础模型只掉了0.9个百分点,几乎可以忽略;但其他训练方法平均要掉3.7到12.5个百分点不等。换句话说,HOTFIXR用了一种"温柔"得多的微调方式,既学到了新东西,又没有把原来会的东西弄丢太多。

最让人在意的其实是跨语言的表现。论文专门统计了模型在完全没训练过的语言(德语、日语,以及在阅读理解任务里的俄语、中文)上的表现变化。结果是这样的:如果用普通的数据选择方法训练,模型在这些陌生语言上的表现平均会掉7到12.5个百分点;但用HOTFIXR训练出来的模型,这些陌生语言上只掉了1.4个百分点。这说明HOTFIXR学到的东西不是死记硬背某几种语言的答案,而是真的在往"更普适的语言理解能力"这个方向靠。

这里必须提一下一个容易被误读的地方。论文的作者们很坦诚地说,HOTFIXR并不是解决多语言一致性问题的终极答案,用几个统计学指标(比如极差、标准差、四分位距)衡量下来,HOTFIXR确实比大部分基线更稳定一些,但优势并不是压倒性的。他们自己在论文里写道,目前还没有哪种数据生成方法能做到多语言表现完全一致,这算是一种研究者的自我克制,没有过度包装成果。

论文还做了一个很扎实的消融实验(ablation study,指逐一去掉某个组件,观察对最终效果的影响,用来验证每个部分是否真的有用),单独测试了前面提到的LAI和LSI这两个信号分别起作用时效果如何。结果发现,单独用LAI或者单独用LSI,效果提升都比较有限,甚至有的配置下反而比只用基础格式奖励略差。但把两者结合起来,效果提升就非常明显了。比如在Qwen2.5-7B上,只用格式奖励时领域内分数是52.0,加上LAI变成50.9(反而略降),加上LSI是50.8,但同时加上LAI和LSI,分数直接跳到57.8。这说明这两个信号不是简单的叠加关系,更像是互相补充,一个抓的是"模型压根不会",另一个抓的是"模型在不同语言下想的不是一回事",两者合力才能真正定位到模型的软肋。

论文还测了一个很实际的问题,如果多迭代几轮HOTFIXR会怎样?他们做了一个"持续学习"实验,训练出一个学生模型之后,再从零训练一个全新的出题模型,去继续教这个已经训练过一次的学生。结果显示,第二轮的提升幅度比第一轮还要大,在Nemotron任务上提升了将近10个百分点,在见过的语言和没见过的语言上都有明显进步(分别提升8个和7个百分点左右)。这暗示了一件事,多语言能力的提升可能不是一次性能补完的,而是可以像"升级打怪"一样,一轮一轮地把模型的能力边界往外推。

写在后面

读到HOTFIXR用隐藏状态的余弦距离来衡量语言表征错位这个设计时,我想起了另一件事。这本质上是在说,正确答案不该随着推理语言的改变而"跑偏",如果模型用中文推理和用英文推理得出的内部状态差异很大,哪怕两次都答对了,这也暴露了模型内部思路其实并不统一,只是恰好蒙对了结果。这个洞察挺犀利的,它没有只看表面的答案对错,而是往模型的"内心活动"里看了一眼。

论文里那个500条种子数据"够用就好"的发现也挺值得琢磨。很多人做数据合成的第一反应是数据越多越好,但这篇论文用reward hacking的例子说明,有时候给强化学习的探索空间留得太大,反而会让模型找到一条"投机"的捷径,专挑一道分数高的题目反复生成。这跟人类学习倒是有点像,给学生一套无限刷不完的题库,未必比精挑细选几百道有代表性的题目更有效。

论文里坦白说标签生成还得依赖一个更大的模型才靠得住,这个局限性没有被藏起来,算是一种挺让人放心的诚实。毕竟很多论文喜欢把方法包装成"完全自主",但现实中AI系统的自我提升目前还很难完全脱离外部的更强模型做校验,这大概是当下这一代技术真实的边界所在。

一个没被这篇论文回答的问题是:如果换成资源特别稀缺的语言,比如斯瓦希里语或者某些方言,这套方法还能不能奏效?论文里明确说了自己只测试了高资源语言,这个坑留给了未来的研究者。低资源语言的数据本身就稀少,用来校准"语言缺陷分数"的种子数据质量能不能保证,这大概是一个更棘手的问题。

Q&A

Q1:HOTFIXR是什么?

A:HOTFIXR是UIUC和Uniphore团队提出的一种数据生成方法,它通过训练一个专门的"出题模型"来探测语言模型的多语言弱点,然后生成针对性的训练数据来补齐这些弱点,从而提升模型的多语言表现,同时尽量不损害模型原有的能力。

Q2:为什么大语言模型在不同语言下表现会不一样?

A:主要原因是大模型的训练数据里英文占绝大多数,模型在处理非英文内容时会先在内部把思路"绕道"到类似英语的表征空间去思考,再翻译回目标语言输出,这导致英语几乎成了模型能力的天花板,其他语言的表现会因为表征错位而打折扣。

Q3:HOTFIXR和单纯把多语言数据训练得更均衡有什么区别?

A:单纯平衡多语言数据训练出来的模型(比如Aya-23)虽然各语言表现更一致,但整体能力会被拉低。HOTFIXR不是简单地均衡数据分布,而是用模型的实际反馈(推理时的犹豫程度和不同语言下内部状态的偏移程度)去定位真正的薄弱环节,针对性生成数据,实验显示这种方法既能提升领域内表现6.2个百分点,又能把领域外任务的性能损失控制在0.9个百分点左右。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郑钦文2-1逆转10后新星,诞生五大不可思议,奥运冠军回来了

郑钦文2-1逆转10后新星,诞生五大不可思议,奥运冠军回来了

南海浪花
2026-09-01 02:43:37
彩票出现断崖式暴跌,“2元中500万”为何没人信了?原因引人深思

彩票出现断崖式暴跌,“2元中500万”为何没人信了?原因引人深思

阿振观点
2026-08-21 05:38:20
深圳街头令人揪心一幕:外卖小哥裹着厚被子睡在电动车上,他就是传说中的“跑单王”,日入500却不舍得犒劳自己

深圳街头令人揪心一幕:外卖小哥裹着厚被子睡在电动车上,他就是传说中的“跑单王”,日入500却不舍得犒劳自己

捣蛋窝
2026-09-01 18:18:04
一刀切关停舞厅,到底是净化风气,还是断了普通人的活路?

一刀切关停舞厅,到底是净化风气,还是断了普通人的活路?

成都人的故事
2026-06-23 22:35:08
终于知道今年为啥又扫黑除恶了

终于知道今年为啥又扫黑除恶了

小鹿姐姐情感说
2026-08-14 01:50:59
3任丈夫都离世,从瑞士回国定居,儿子曾入狱,今与女儿相依为命

3任丈夫都离世,从瑞士回国定居,儿子曾入狱,今与女儿相依为命

暖心萌阿菇凉
2026-09-01 05:41:01
阴阳先生看房子风水:卧室里若有这2个东西,无论多贵也要丢掉

阴阳先生看房子风水:卧室里若有这2个东西,无论多贵也要丢掉

磊子讲史
2026-03-28 18:32:26
原来不是演的!这5位演员竟然真当过警察,最后这位还是“警花”

原来不是演的!这5位演员竟然真当过警察,最后这位还是“警花”

皮皮电影
2026-09-01 22:20:03
父亲曾因没钱放弃网球,母亲在宜家打工:阿尔卡拉斯的家庭底色

父亲曾因没钱放弃网球,母亲在宜家打工:阿尔卡拉斯的家庭底色

坠入温柔晚风
2026-09-01 00:03:08
20岁小伙发现彩票终极奥秘,一年豪赚80亿,现金堆满豪宅

20岁小伙发现彩票终极奥秘,一年豪赚80亿,现金堆满豪宅

灿烂夏天
2024-12-22 22:20:12
离婚10年后意外调任到前妻老家,我去探望前岳母,打开门后我愣了

离婚10年后意外调任到前妻老家,我去探望前岳母,打开门后我愣了

千秋文化
2026-07-13 19:26:02
美伊互轰导弹背后到底是什么算计?

美伊互轰导弹背后到底是什么算计?

海格看世界
2026-09-01 04:20:13
苏联曾承诺,1995年将海参崴港口归还中国,为何如今却杳无音信?

苏联曾承诺,1995年将海参崴港口归还中国,为何如今却杳无音信?

搜史君
2026-08-30 16:30:12
股价突然一头栽下,市值蒸发百亿,星宇股份的麻烦远不止下跌

股价突然一头栽下,市值蒸发百亿,星宇股份的麻烦远不止下跌

小徐讲八卦
2026-09-01 11:52:20
蓝蟹入侵意大利怎么就没个完美解法?

蓝蟹入侵意大利怎么就没个完美解法?

海格看世界
2026-09-01 04:15:46
黄维被俘前,41岁熊绶春战死双堆集,蒋介石:他比黄维更忠心党国

黄维被俘前,41岁熊绶春战死双堆集,蒋介石:他比黄维更忠心党国

史笔似尘钩
2025-10-29 23:19:31
中国果然没有看错伊朗,穆杰塔巴通告世界,美国的阴谋全泡汤

中国果然没有看错伊朗,穆杰塔巴通告世界,美国的阴谋全泡汤

快乐彼岸
2026-08-31 11:41:26
曼城压哨敲定恩佐,1.45亿欧追平英超转会纪录

曼城压哨敲定恩佐,1.45亿欧追平英超转会纪录

足球推文C
2026-09-01 18:48:11
90%司机都没用对高德!这8个设置一开,太方便了!

90%司机都没用对高德!这8个设置一开,太方便了!

沙雕小琳琳
2026-08-25 10:37:41
御林军球迷因在申花客场穿不文明文字服装,被北京赛区追加禁赛10场

御林军球迷因在申花客场穿不文明文字服装,被北京赛区追加禁赛10场

懂球帝
2026-09-01 19:03:26
2026-09-02 02:11:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9705文章数 568关注度
往期回顾 全部

科技要闻

抖音突发推荐算法大面积错乱!

头条要闻

男子将千万房子99%产权给妻子 妻子离婚要求分割

头条要闻

男子将千万房子99%产权给妻子 妻子离婚要求分割

体育要闻

大爹杨瀚森,让中国男篮有了容错空间

娱乐要闻

孙宇晨破防,他无法接受孙割这个名字

财经要闻

"电梯亲热门"后 惠州首富给老婆转238亿

汽车要闻

山城试驾启源Q06 不光是智驾好用还有700km的续航

态度原创

手机
房产
艺术
本地
公开课

手机要闻

8月安兔兔安卓手机性能榜出炉:红魔11S Pro+、iQOO 15 Ultra争第一

房产要闻

1.72万/㎡!断供十余年,科学城核心区终于开仓了!

艺术要闻

他笔下的女人,像从宋词里走出来的诗魂:80后油画家赵也,用画笔把东方美定格成永恒

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版