多语言大模型的训练一直有个老大难问题:像英语这样的高资源语言数据充足,模型学得又快又好;但到了小语种,训练数据捉襟见肘,模型表现就大打折扣。Apple研究者最近提出一种名为LINK的数据级干预方法,不需要额外训练阶段,也不需要翻译系统,仅靠一份双语词典就能显著提升低资源语言的下游任务表现,训练速度最高还能提升2倍。
这项研究发表在arXiv上,作者团队来自Apple。论文标题为《Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions》,核心思路非常直接:在预训练阶段,对高资源语言(英语)语料中的部分词汇做词级替换,换成目标语言的对应翻译词,让模型在预训练过程中就接触到跨语言信号。
![]()
低资源语言的困境:知识从哪来?
对于训练数据不足的语言来说,很多下游任务——比如科学推理、常识推断、世界知识问答——所需的知识没法从自身语料里学到,只能依赖高资源语言迁移过来。但现有的跨语言知识迁移方法,普遍依赖大规模平行语料、机器翻译系统、辅助模型或者额外的训练阶段,这些资源恰恰是低资源语言最缺的。
LINK方法的巧妙之处在于绕开了这些瓶颈。它只需要一份双语词汇表——这种资源几乎可以以零成本为任何语言获取。具体操作是:在英语训练语料的一部分中,按设定的替换比例,随机选取单词替换为对应的目标语言翻译词。整个过程不需要额外训练模型,纯粹是数据层面的干预。
实验数据:8种语言、5种模型规模
研究团队在8种语言、5种模型规模上做了系统评估,结果显示LINK在目标语言的下游任务上带来了显著提升。更值得注意的是训练效率的变化:在达到同等性能水平的情况下,LINK最多能带来2倍的训练加速。这意味着,用更少的训练步数就能达到和基线方法相同的效果。
从方法设计上看,LINK有几个明显的工程优势:
- 零额外训练成本:不需要设计辅助任务,不需要多阶段训练流程,直接在预训练数据上做替换即可
- 资源门槛极低:双语词汇表几乎是任何语言都能低成本获取的资源,不像平行语料那样稀缺
- 即插即用:可以无缝集成到现有的预训练流程中,不需要改动模型架构
词汇替换为什么有效?
这个方法的底层逻辑其实不难理解。多语言模型在预训练阶段如果没有显式的跨语言信号,不同语言的知识表征往往是割裂的。通过在英语语料中混入目标语言的词汇,模型被迫在同一个上下文中处理两种语言的词汇,这就在表征空间里建立了跨语言的关联锚点。
比如一个常识推理任务,如果模型在预训练时见过"猫坐在<垫子>上"这样的混合语言样本,它就能更容易地把英语学到的常识知识映射到目标语言的词汇上。这种词汇级的干预虽然简单,但直接作用于预训练的核心环节,效果反而比复杂的后处理方法更本质。
2倍加速意味着什么?
训练加速2倍这个数字,放在大模型训练的语境下相当可观。多语言模型的预训练成本动辄数百万美元,如果能用一半的训练步数达到同等效果,节省的算力成本是实打实的。对于资源有限的学术团队和小型公司来说,这种数据层面的优化比架构创新更容易落地。
当然,这项研究也有它的边界。论文评估的是8种语言、5种模型规模下的表现,LINK在更多语言、更大模型上的泛化能力还有待验证。另外,替换比例的设定、双语词汇表的质量对效果的影响,论文中也没有给出非常细致的消融分析。
跨语言迁移的另一种思路
业界做跨语言知识迁移,主流路线一直是模型层面的:要么设计多语言共享的模型架构,要么在预训练之后加对齐训练阶段。LINK提供的是一个完全不同的切入点——在数据层面做文章。这种思路的好处是解耦了数据准备和模型训练,数据团队可以独立优化替换策略,模型团队不需要改动任何东西。
从实际部署的角度看,LINK的工程友好度很高。它不依赖机器翻译系统,不需要平行语料,甚至不需要目标语言的大规模单语语料——只需要一份双语词汇表。这意味着,即使是数据极度稀缺的语言,也有机会通过这种方式获得更好的多语言模型支持。
多语言AI的普惠价值不用多说,全球有数千种语言在数字世界中处于边缘地位。LINK这种低门槛的技术方案,至少提供了一条让更多语言被AI覆盖的可行路径。虽然它不能解决所有问题,但方向是对的。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.