网易首页 > 网易号 > 正文 申请入驻

让AI模型学会“看语言脸色”:一个专治多语言偏科的数据生成新方法

0
分享至

你有没有想过,同一个AI模型,用中文问它和用英文问它,可能会得到完全不同质量的答案?

这不是错觉。2024年有研究团队做了个实验,让Qwen2.5这个大模型回答同一批多语言阅读理解题目,结果发现:用英文提问,正确率能到84.3%;换成阿拉伯语提问,同样的题目,正确率直接掉到63.6%。整整21个百分点的差距,意味着什么?意味着每5道题里,用阿拉伯语提问就要比用英文提问多错1道。

这个现象有个学名,叫语言特定能力差异(Language-Specific Competency,简称LSC,指同一个语言模型对语义相同的问题,用不同语言提问会给出不同甚至错误答案的现象)。听起来有点抽象,但换个说法你就懂了:这就好像一个双语翻译,用母语聊天时思路清晰、旁征博引,可一旦切换到第二语言,同样的话题却开始磕磕巴巴、丢三落四。语言没变意思,但表达质量断崖式下跌。

这篇来自UIUC和Uniphore团队的论文,就是想解决这个让人头疼的问题。他们提出了一个叫HOTFIXR的方法,试图找到一条中间道路,既不让模型变成"英语脑袋",也不让它在追求语言公平的过程中变得平庸。

为什么会有这种偏科现象

要理解这个问题的根源,得先说说大模型是怎么"思考"的。

现在主流的大语言模型,训练数据里英文占了绝大多数。这就导致一个有趣的副作用:模型在处理非英文文本时,会先在内部把这些内容"翻译"成英文式的思维过程,理解完了再翻译回目标语言输出。有研究者专门去看过模型内部的信息流动,发现在处理多语言输入时,模型确实在中间层大量地"绕道"英语空间,思考完之后再绕回目标语言的表达空间。

这就带来一个很关键的后果:英语几乎成了模型能力的天花板。凡是能用英语说清楚的概念,模型答对的概率就高;而那些在英语里没有直接对应说法的概念,或者英语语料里本来就覆盖不足的知识,模型用其他语言问出来时,答案质量就会打折。

这里要引入一个概念,表征错位(representational misalignment,指模型对同一个语义概念,在不同语言中形成了不一致的内部表示)。

论文里提到这种错位主要表现为三种情况:一是语言特定知识差异,同一个事实性问题用不同语言问,模型给出的答案可能不一样;二是非同构性(non-isomorphism,指某些词语或短语在不同语言之间没有直接对应的翻译),比如中文里的"缘分"很难找到一个英文单词完全对应;三是非组合性(non-compositionality,指一个短语的整体含义无法从组成它的单个词汇推导出来),最典型的例子就是成语和惯用语,字面翻译往往面目全非。

那有没有可能直接用"打平"数据分布的办法解决问题?还真有团队试过。Cohere公司训练了一个叫Aya-23的模型,特意在预训练阶段把23种语言的数据尽量平衡。结果确实很有意思:在前面提到的多语言阅读理解测试里,Aya-23在不同语言之间的表现变得相当一致,阿拉伯语和英语的差距明显缩小了。但代价也很明显,它在英语上的绝对表现,反而不如那个"偏科"的Qwen2.5——Qwen在英语上能到84.3%,Aya-23只有70.6%。

这其实呼应了一个更早的发现,语言学界把这个现象叫作"多语言的诅咒"(Curse of Multilinguality,指随着预训练数据中语言种类的增多,模型在单一语言上的整体表现会趋于停滞甚至下降的规律)。

这就形成了一个两难局面:要么你把资源全押在英语上,牺牲其他语言的表现;要么你追求语言间的公平,但代价是整体能力被拉低到一个中庸水平。这种取舍就好像一个班主任分配辅导时间,如果把所有精力都投给数学最好的那几个学生,班级数学平均分会很漂亮,但偏科生永远补不上;如果非要把时间平均分给每个学生,整体平均分反而会被拖累,因为原本可以冲得更高的尖子生没有得到足够的资源。这篇论文想问的是,有没有第三条路,能不能找到一种更聪明的辅导方式,既不放弃尖子生的潜力,也能把偏科生的短板补上,而不是简单地平均分配时间。

HOTFIXR到底是怎么运作的

论文提出的方法叫HOTFIXR,全称是Hardness Optimized Training-data For Improving X-lingual Reasoning(难度优化的训练数据生成框架,用于提升跨语言推理能力)。

这个名字听起来挺学术,但核心思路其实很直白:不要瞎猜模型哪里弱,而是让模型自己"暴露"弱点,然后针对性地生成练习题去补。

具体是怎么做到的?这里要先解释一个概念,acquisition function(获取函数,原本是数据选择和主动学习领域的术语,指一种评分标准,用来判断某个数据样本对训练是否有价值)。

在HOTFIXR里,研究团队设计了一个叫"语言缺陷分数"(Lingual Deficit Score)的指标,专门用来衡量一道题目对模型的多语言能力来说有多"难啃"。这个分数由两部分组成。

第一部分叫语言无关的能力不足(Language-Agnostic Incompetency,简称LAI,指模型无论用哪种语言回答,都表现出的不确定性)。具体做法是,让模型用它最擅长的语言(通常假设是英语)去推理一道题,然后看模型在生成答案的过程中,每一步选词时有多"犹豫"。如果模型对下一个词该选什么都拿不准,那说明这道题本身就超出了模型的能力边界,不管换哪种语言都可能答错。

第二部分叫语言特定的能力不足(Language-Specific Incompetency,简称LSI,指模型在用不同语言推理同一道题时,内部表征出现的偏移程度)。做法是让模型分别用英语和另一种语言(比如西班牙语)去推理同一道题,然后抓取模型在做出最终回答前那一刻的内部隐藏状态,计算两次推理隐藏状态之间的"距离"。如果这个距离很大,说明模型在用不同语言思考同一件事时,脑子里想的其实不是一回事,这就是表征错位在起作用。

这两个分数加起来,就是一道题目的综合"缺陷分数"。分数越高,说明这道题越能戳中模型的多语言软肋,也就越值得拿来训练。

那这些题目从哪来?这里就要提到整个流程里最巧妙的一环了。研究团队训练了一个专门的题目生成模型,让它根据学生模型(也就是需要被改进的目标模型)反馈的缺陷分数,不断调整自己生成题目的策略。这个优化过程用的是GRPO算法(Group Relative Policy Optimization,一种强化学习优化方法,最早在DeepSeekMath论文中被提出用于提升数学推理能力)。

说得更形象一点,这就像是请了一位家教,但这位家教一开始并不知道学生哪里薄弱。传统的做法是家教自己出一套通用卷子给学生做,做完批改,看看哪里错得多。但HOTFIXR的做法更进一步,这位家教会不断出题、观察学生的反应(犹豫、内部思路混乱的程度),然后根据反应调整下一次出题的方向,专挑那些让学生最纠结、最容易在不同语言间"打岔"的题型。如果不这样做,让家教随便出题会怎样?论文里的对照实验其实回答了这个问题,那些用未经训练的模型随机生成题目的方法(论文里叫Untrained基线),效果明显不如经过针对性优化的HOTFIXR,在跨领域任务上平均只领先基线1.4个百分点,而HOTFIXR能领先5.6个百分点。

值得一提的是,研究团队在训练这个"出题家教"模型时只用了500道种子题目,看起来数量很少。但这是有意为之的,他们发现如果给的种子题目太多,出题模型会出现reward hacking(奖励作弊,指模型找到了一个能拿高分但没有实际训练价值的"捷径",然后反复利用这个捷径而不再探索)的问题。具体表现是,出题模型会找到一道让缺陷分数特别高的题目,然后不管怎么换提示词,都反复生成几乎一样的题目。这就好比考试作弊被抓的学生发现了一道题的答案能蒙对,之后每次都写同一个答案,完全不再思考新题目。为了避免这种情况,研究团队把强化学习的优化步数控制在40步左右,种子数据也压缩到500条,这样既能让模型学到有效的出题策略,又不至于让它"偷懒"钻牛角尖。

生成出来的高质量题目,还需要标准答案。研究团队用了一个更大的模型Qwen2.5-32B-Instruct来给这些新生成的题目打标准答案,因为他们在预实验里发现,如果让被训练的学生模型自己给自己出的题打分,标签质量会很差,模型经常连"请用指定语言回答"这种基本指令都执行不好。这也算是一个诚实的局限性披露,整个流程还是依赖一个足够强的外部模型来兜底答案质量。

效果到底怎么样

光说方法巧妙没用,得看数据说话。

论文在三个模型上做了测试:Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct,以及Meta的Llama-3.1-8B-Instruct。测试任务分成两大类,一类是训练数据覆盖到的领域内任务(Nemotron数据集的STEM、数学、对话三个子集),另一类是训练时没见过的领域外任务,包括事实性知识问答(MMMLU)、多语言检索增强问答(mHotPotQA)、以及翻译任务(OPUS-100)。语言方面,训练用的六种语言是英语、法语、西班牙语、阿拉伯语、葡萄牙语、意大利语,另外还专门留了德语和日语作为完全没见过的语言,用来检验模型是不是真的学到了普适的多语言能力,而不是只在训练语言上刷分。

先看领域内的表现。HOTFIXR相比基础模型(也就是完全没做任何微调的原始模型)平均提升了6.2个百分点。相比其他数据生成和数据选择的基线方法(比如直接用现成数据训练、用未经优化的模型出题、或者DataEnvGym这种不区分语言的通用数据生成方法),HOTFIXR的优势更明显,平均领先6.0到7.3个百分点不等。

再看领域外任务。这里的核心矛盾在于,大部分微调方法为了让模型在特定任务上变强,往往会牺牲模型在其他任务上的表现,这个现象业内叫"灾难性遗忘"。论文里给出的数据显示,HOTFIXR相比基础模型只掉了0.9个百分点,几乎可以忽略;但其他训练方法平均要掉3.7到12.5个百分点不等。换句话说,HOTFIXR用了一种"温柔"得多的微调方式,既学到了新东西,又没有把原来会的东西弄丢太多。

最让人在意的其实是跨语言的表现。论文专门统计了模型在完全没训练过的语言(德语、日语,以及在阅读理解任务里的俄语、中文)上的表现变化。结果是这样的:如果用普通的数据选择方法训练,模型在这些陌生语言上的表现平均会掉7到12.5个百分点;但用HOTFIXR训练出来的模型,这些陌生语言上只掉了1.4个百分点。这说明HOTFIXR学到的东西不是死记硬背某几种语言的答案,而是真的在往"更普适的语言理解能力"这个方向靠。

这里必须提一下一个容易被误读的地方。论文的作者们很坦诚地说,HOTFIXR并不是解决多语言一致性问题的终极答案,用几个统计学指标(比如极差、标准差、四分位距)衡量下来,HOTFIXR确实比大部分基线更稳定一些,但优势并不是压倒性的。他们自己在论文里写道,目前还没有哪种数据生成方法能做到多语言表现完全一致,这算是一种研究者的自我克制,没有过度包装成果。

论文还做了一个很扎实的消融实验(ablation study,指逐一去掉某个组件,观察对最终效果的影响,用来验证每个部分是否真的有用),单独测试了前面提到的LAI和LSI这两个信号分别起作用时效果如何。结果发现,单独用LAI或者单独用LSI,效果提升都比较有限,甚至有的配置下反而比只用基础格式奖励略差。但把两者结合起来,效果提升就非常明显了。比如在Qwen2.5-7B上,只用格式奖励时领域内分数是52.0,加上LAI变成50.9(反而略降),加上LSI是50.8,但同时加上LAI和LSI,分数直接跳到57.8。这说明这两个信号不是简单的叠加关系,更像是互相补充,一个抓的是"模型压根不会",另一个抓的是"模型在不同语言下想的不是一回事",两者合力才能真正定位到模型的软肋。

论文还测了一个很实际的问题,如果多迭代几轮HOTFIXR会怎样?他们做了一个"持续学习"实验,训练出一个学生模型之后,再从零训练一个全新的出题模型,去继续教这个已经训练过一次的学生。结果显示,第二轮的提升幅度比第一轮还要大,在Nemotron任务上提升了将近10个百分点,在见过的语言和没见过的语言上都有明显进步(分别提升8个和7个百分点左右)。这暗示了一件事,多语言能力的提升可能不是一次性能补完的,而是可以像"升级打怪"一样,一轮一轮地把模型的能力边界往外推。

写在后面

读到HOTFIXR用隐藏状态的余弦距离来衡量语言表征错位这个设计时,我想起了另一件事。这本质上是在说,正确答案不该随着推理语言的改变而"跑偏",如果模型用中文推理和用英文推理得出的内部状态差异很大,哪怕两次都答对了,这也暴露了模型内部思路其实并不统一,只是恰好蒙对了结果。这个洞察挺犀利的,它没有只看表面的答案对错,而是往模型的"内心活动"里看了一眼。

论文里那个500条种子数据"够用就好"的发现也挺值得琢磨。很多人做数据合成的第一反应是数据越多越好,但这篇论文用reward hacking的例子说明,有时候给强化学习的探索空间留得太大,反而会让模型找到一条"投机"的捷径,专挑一道分数高的题目反复生成。这跟人类学习倒是有点像,给学生一套无限刷不完的题库,未必比精挑细选几百道有代表性的题目更有效。

论文里坦白说标签生成还得依赖一个更大的模型才靠得住,这个局限性没有被藏起来,算是一种挺让人放心的诚实。毕竟很多论文喜欢把方法包装成"完全自主",但现实中AI系统的自我提升目前还很难完全脱离外部的更强模型做校验,这大概是当下这一代技术真实的边界所在。

一个没被这篇论文回答的问题是:如果换成资源特别稀缺的语言,比如斯瓦希里语或者某些方言,这套方法还能不能奏效?论文里明确说了自己只测试了高资源语言,这个坑留给了未来的研究者。低资源语言的数据本身就稀少,用来校准"语言缺陷分数"的种子数据质量能不能保证,这大概是一个更棘手的问题。

Q&A

Q1:HOTFIXR是什么?

A:HOTFIXR是UIUC和Uniphore团队提出的一种数据生成方法,它通过训练一个专门的"出题模型"来探测语言模型的多语言弱点,然后生成针对性的训练数据来补齐这些弱点,从而提升模型的多语言表现,同时尽量不损害模型原有的能力。

Q2:为什么大语言模型在不同语言下表现会不一样?

A:主要原因是大模型的训练数据里英文占绝大多数,模型在处理非英文内容时会先在内部把思路"绕道"到类似英语的表征空间去思考,再翻译回目标语言输出,这导致英语几乎成了模型能力的天花板,其他语言的表现会因为表征错位而打折扣。

Q3:HOTFIXR和单纯把多语言数据训练得更均衡有什么区别?

A:单纯平衡多语言数据训练出来的模型(比如Aya-23)虽然各语言表现更一致,但整体能力会被拉低。HOTFIXR不是简单地均衡数据分布,而是用模型的实际反馈(推理时的犹豫程度和不同语言下内部状态的偏移程度)去定位真正的薄弱环节,针对性生成数据,实验显示这种方法既能提升领域内表现6.2个百分点,又能把领域外任务的性能损失控制在0.9个百分点左右。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美媒急了:中国重型战斗机数量超北约总和,美军连一半都不到

美媒急了:中国重型战斗机数量超北约总和,美军连一半都不到

瞩望云霄
2026-08-30 20:03:02
开豪车住别墅打造“富婆”人设!网红“曲靖丽姐”涉嫌刑案被警方调查

开豪车住别墅打造“富婆”人设!网红“曲靖丽姐”涉嫌刑案被警方调查

红星新闻
2026-09-01 15:28:36
申花泰山耻辱出局!媒体人开炮:涉案扣分不是能够掩盖一切的理由

申花泰山耻辱出局!媒体人开炮:涉案扣分不是能够掩盖一切的理由

奥拜尔
2026-09-01 21:55:57
宇树科技员工爆 “惊人内幕”,王兴兴天塌了!

宇树科技员工爆 “惊人内幕”,王兴兴天塌了!

营销报
2026-09-01 21:23:58
爱沙尼亚情报局长:俄罗斯内部剧变或在一夜间发生

爱沙尼亚情报局长:俄罗斯内部剧变或在一夜间发生

名人苟或
2026-09-01 17:41:48
28岁内地女主播诬告强奸在澳门被捕,因与男子发生性关系索2万港元未果

28岁内地女主播诬告强奸在澳门被捕,因与男子发生性关系索2万港元未果

可达鸭面面观
2026-08-31 13:50:36
沧州市教育局,你也太丢人了!

沧州市教育局,你也太丢人了!

新区晚参
2026-09-01 11:59:29
刘亦菲妈妈近照曝光!67岁仍优雅,戴百万手镯,无惧和陈金飞绯闻

刘亦菲妈妈近照曝光!67岁仍优雅,戴百万手镯,无惧和陈金飞绯闻

叶公子
2026-09-01 13:02:38
曝科大讯飞高管出轨女下属,大尺度聊天曝光,女方很漂亮,两人多次开房

曝科大讯飞高管出轨女下属,大尺度聊天曝光,女方很漂亮,两人多次开房

180视角
2026-09-01 13:38:02
中国男篮确认:杨瀚森将缺席后续所有世预赛

中国男篮确认:杨瀚森将缺席后续所有世预赛

环球网资讯
2026-09-01 14:05:25
失控!孙宇晨或保不住了!

失控!孙宇晨或保不住了!

财经要参
2026-09-01 07:20:14
武汉街头正大量出现,20岁大学生一个月赚了7000元;有人半天花掉两三百元,“这钱花得值”

武汉街头正大量出现,20岁大学生一个月赚了7000元;有人半天花掉两三百元,“这钱花得值”

极目新闻
2026-09-01 13:04:24
皇马将西藏与尼泊尔并列拒绝改正

皇马将西藏与尼泊尔并列拒绝改正

第一财经资讯
2026-09-02 00:11:54
苹果新CEO上任首日!新iPhone被曝恢复赠送充电头、有线耳机 官方回应

苹果新CEO上任首日!新iPhone被曝恢复赠送充电头、有线耳机 官方回应

快科技
2026-09-02 00:50:09
媒体曝宇树超100元报销都需王兴兴批,员工称奖惩机制只有罚几乎没有奖

媒体曝宇树超100元报销都需王兴兴批,员工称奖惩机制只有罚几乎没有奖

金融界
2026-09-01 14:17:17
联邦警卫局第4次扩编,普京:他们会绞死我

联邦警卫局第4次扩编,普京:他们会绞死我

西楼饮月
2026-09-01 19:21:39
意在施压英国增加国防开支?英媒:特朗普首度公开介入,称正重审美国在马岛争端立场

意在施压英国增加国防开支?英媒:特朗普首度公开介入,称正重审美国在马岛争端立场

环球网资讯
2026-09-01 18:10:36
孙宇晨和景甜的瓜反转了,大量照片和聊天记录流出!

孙宇晨和景甜的瓜反转了,大量照片和聊天记录流出!

七阿姨爱八卦
2026-09-01 10:46:18
“小红书Agency”2026的进阶之道:行业化

“小红书Agency”2026的进阶之道:行业化

刀姐doris
2026-08-27 17:22:54
22页出轨PDF疯传,内容相当劲爆!

22页出轨PDF疯传,内容相当劲爆!

车轱辘话V
2026-09-01 11:24:27
2026-09-02 05:56:49
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
737文章数 9414关注度
往期回顾 全部

科技要闻

抖音突发推荐算法大面积错乱!

头条要闻

美国银行副总裁在纽约时代广场被刺身亡 年仅32岁

头条要闻

美国银行副总裁在纽约时代广场被刺身亡 年仅32岁

体育要闻

大爹杨瀚森,让中国男篮有了容错空间

娱乐要闻

孙宇晨破防,他无法接受孙割这个名字

财经要闻

"电梯亲热门"后 惠州首富给老婆转238亿

汽车要闻

山城试驾启源Q06 不光是智驾好用还有700km的续航

态度原创

时尚
数码
旅游
房产
公开课

夏天别总穿黑色裤子,试试这几款高腰裙,显瘦优雅又提气质

数码要闻

高通发布跃龙Q-2390、IQ-2390物联网处理器

旅游要闻

永定河森林公园轮渡码头将全线运营

房产要闻

1.72万/㎡!断供十余年,科学城核心区终于开仓了!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版