网易首页 > 网易号 > 正文 申请入驻

大模型的能力从哪些训练数据来?北大&智源提出「机理数据归因」

0
分享至



近年来,大语言模型展现出了越来越强的能力,从上下文学习(In-Context Learning, ICL)到复杂推理、代码生成,这些能力不断刷新人们对模型能力边界的认知。

然而,对于这些能力究竟从何而来、又是在训练过程中如何形成的,我们仍然知之甚少。

近年来兴起的机理可解释性(Mechanistic Interpretability)研究,开始尝试揭示模型内部的计算机制。例如,「归纳头」(Induction Heads)被广泛认为是大模型涌现上下文学习能力的关键神经机制。这类注意力头能够识别并复制先前出现的模式,从而实现类似「从示例中学习」的行为。相关研究不仅在多个模型中发现了归纳头的存在,也较为清晰地刻画了它们在推理阶段的工作方式。

然而,这类研究大多停留在事后分析(post hoc analysis)层面。我们能够揭示模型内部的计算机制,并把计算机制逆向拆解成可理解的「电路」。我们能描述一个电路在推理时「算什么」,却回答不了它「怎么来」—— 是哪一部分训练数据、以怎样的方式,在预训练过程中把它塑造了出来?例如,我们已经能够观察归纳头在训练完成后的功能,却仍不清楚它们究竟是如何在预训练过程中形成的。

更进一步地,究竟是哪一部分训练数据塑造了这种能力?是结构严谨的教科书文本,还是蕴含大量重复模式与逻辑结构的代码语料?这些问题至今仍缺乏明确答案。

来自北京大学计算机学院和北京智源人工智能研究院的研究者,正是从这个被长期忽视的「数据溯源」维度切入,提出了机理数据归因(Mechanistic Data Attribution, MDA)框架。它第一次把可解释性的提问,从「模型内部有什么机制」,推进到「这些内部机制是被哪些训练数据因果地塑造出来的」—— 并由此打通了一条「训练数据 → 内部机制 → 模型行为」的因果链条。

而沿着这条链条,他们得到了一个相当反直觉的答案:真正催化归纳头形成的,并不是人类眼中「高质量」的优美文本。那些看似杂乱无章、包含大量重复结构的「垃圾数据」(如 XML 标签、乱码般的 Base64 字符串、LaTeX 源代码),才是塑造归纳头的核心动力。

该工作已被机器学习顶级会议ICML 2026 接收为 Oral & Spotlight(168 / 23,918,录用比 Top 0.7%)。



  • 论文标题:Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
  • 论文链接:https://arxiv.org/pdf/2601.21996
  • 代码链接:https://github.com/chenjianhuii/Mechanistic-Data-Attribution

MDA 框架:可解释单元级别的训练数据归因

要理解 MDA 的新意,先要看清它和传统方法的分界。

经典的训练数据归因(Training Data Attribution, TDA)关注的是「某条数据对模型整体 Loss 的影响」。这就像只用一个人的「整体健康状况」,去倒推他某天吃下的一粒维生素起了什么作用。这种方式粒度太粗、计算昂贵,也无法对应到任何一个具体的内部机制。

MDA 的核心转变在于:不再关注全局模型行为,而是通过影响函数(Influence Functions)精确追踪特定「可解释单元」(如归纳头)的形成源头。



图一:MDA 框架总览。从定位可解释单元,到计算数据影响力,再到因果验证与干预。

具体而言,MDA 是一个三阶段框架:

  1. 定位(Localizing):首先定义可解释单元的监测指标(如针对归纳头的前缀匹配分数),定位那些具备可解释性的关键单元(例如神经元、注意力头等)及其参数子空间;
  2. 归因(Computing):利用 EK-FAC(特征值校正的 Kronecker 因子近似曲率)技术,高效估算海量训练数据对特定参数子空间的影响分数。这使得在大规模预训练语料中进行归因成为可能;
  3. 干预(Intervening):通过「数据删除」与「数据增强」实验,因果性地验证被筛出的高影响样本是否真的塑造了目标机制。

值得一提的是,MDA 的计算开销随模型规模呈亚线性增长,作者还在 OLMo-2 1B / 7B 上做了定性验证,表明这套归因方法在更大模型上依然能稳定捕捉到一致的结构模式。

归纳头形成的关键数据:重复的结构,比语义更重要

在 Pythia 模型家族(14M–160M)上的系统分析,揭示了归纳头形成背后一系列令人意外、却又自洽的规律:

1.高影响力样本特征

对于归纳头的形成,在按影响力排序的训练数据中,排名前列的往往不是人类认为「高质量」的自然语言文本,而是充斥着重复结构的数据:

  • XML/HTML 代码:充满重复的标签结构;
  • LaTeX 源码:包含大量的符号和格式指令;
  • UUID 与日志:看似无意义的字符串重复;
  • Base64 编码:字符层面的密集重复。



表一:代表性高影响力样本示例

更关键的是,这些影响分数呈现出清晰的幂律分布 —— 约 10% 的样本,贡献了高达 50% 的累计影响力。也就是说,归纳头机制的形成确实被一小撮「高杠杆」信号显著驱动。

结论: 归纳头的形成并不依赖于高深的语义逻辑,而是被这些高频重复的结构模体(Structural Motifs) 所「催化」的。

这背后的解释相当自洽:归纳头的本职工作就是「识别并复制重复模式」,那么真正能高效「训练」它的习题,自然就是这些充满重复结构的数据。

2.因果验证:删除会抑制,增强会催化

从训练数据到内部机制的因果验证:

训练数据的影响分数只能代表「相关性」,因果验证才是 MDA 的核心。作者在 Pythia 全家族、两类注意力头(归纳头与前序词元头)上做了双向干预:

  • 删除实验(必要性):剔除 MDA 识别出的高影响样本(≤10%),归纳头的形成被显著抑制或延后;而随机删除等量的其他样本,几乎没有影响;
  • 增强实验(充分性):反之,仅重复这一小撮关键样本,就能让归纳头提前涌现;同样地,随机增强无此效果。

从内部机制到模型能力的因果验证:

另外,「归纳头是 ICL 的基础」是领域内长期的核心假设,但此前的证据主要是观测性的。借助 MDA 的精准干预,作者得以从训练动态的视角检验这一因果链:在完全相同的删除 / 增强设置下,归纳头强度与 ICL 得分呈现「同升同降」的紧密耦合。抑制归纳头形成会削弱 ICL,强化则会提升。





图二:因果验证实验(上)归纳头分数(下)ICL 能力分数。红线显示剔除 MDA 识别的数据后,归纳头形成被延后;绿线显示增强这些数据后,归纳头迅速涌现,而 ICL 能力与归纳头变化完全同步。

通过以上两部分的因果干预试验,MDA 打通了一条「训练数据 → 内部机制 → 模型行为」的完整因果链条。

从「事后解释」到「事前干预」:机理数据增强

如果我们已经知道了驱动某个机制形成的数据「配方」,能不能主动合成这类数据,去定向催化模型的特定能力?

论文顺势提出了一种机理数据增强框架(Mechanistic Data Augmentation):

  1. 小模型「探路」:利用较小的模型(如 Pythia-14M)运行 MDA,挖掘出高影响力样本;
  2. 大模型总结:让 DeepSeek-V3 等大模型分析这些样本,提取出样本中的共同结构特征;
  3. 批量合成数据:让大模型编写自动生成符合这些结构特征的合成数据的可执行代码。



图三:合成数据在不同规模模型上的效果。仅用 14M 模型挖掘出的模式生成的合成数据,就能在 160M 模型上显著加速归纳头的形成。

实验结果有两点令人振奋:

  • 跨尺度一致提升:这种基于机理的数据增强具有一致的「跨尺度迁移性」。同一套合成数据,在 14M / 31M / 70M / 160M 上分别带来+12.3% / +10.8% / +15.8% / +9.8%的归纳头得分提升。更有意思的是,从 14M 小模型提炼出的模式,迁移到 160M 模型上的效果,甚至超过了直接从 160M 自身提炼的数据—— 说明催化归纳头的结构「配方」在很大程度上是尺度无关的,可以用小模型作为低成本代理来优化大模型训练。
  • 不牺牲通用能力:在 Wikitext-103 语言建模与 PopQA 事实问答上,增强后的模型与基线曲线几乎重合,没有出现可统计区分的退化。这一对照排除了使用 MDA 会导致「为催化特定电路而损害整体能力」的担忧。

结语

MDA 的意义远不止「一个更精细的数据归因工具」。它标志着可解释性研究的一次角色转变 ——从只会「解释模型里有什么」,走向能够「回答它从哪来、并动手干预它如何形成」。

更进一步,它为一个更大的愿景提供了一块基石:让大模型的训练,从经验主导的「黑盒炼丹」,走向机理驱动的「白盒构建」。沿着「数据 → 机制 → 行为」这条被 MDA 打通的因果链,至少有三个方向可以被打开:

  • 数据治理的新视角:传统「高质量数据清洗」可能会误删那些对底层机制至关重要的「重复性废话」。MDA 提醒我们,数据的价值需要从「对机制的因果贡献」重新评估。
  • 更高效的预训练(潜在方向):通过定向合成承载特定机制的结构数据,有望降低能力形成所需的训练成本 —— 本文已给出小规模上的有力证据,更大规模的系统验证则是值得期待的下一步。
  • 更本质的机理对齐:当我们能在数据层面精确地催化或抑制某个内部机制,「定向切除有害回路或偏见」这类更深层的对齐与遗忘(unlearning),就从理念变得有了可操作的抓手。

在大模型炼丹术日益精细的今天,MDA 带来的是一把能追溯到数据源头的显微镜 —— 它让我们第一次有机会认真追问:模型的每一项能力,到底是被哪些数据、以怎样的方式塑造出来的。未来,当这个问题能被系统地回答,大模型的「黑盒」,也许就不再那么黑了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“像女生器官,不许摆在桌子上!”小仙女怒怼男同学,令人生理不适

“像女生器官,不许摆在桌子上!”小仙女怒怼男同学,令人生理不适

妍妍教育日记
2026-08-08 11:25:10
对话宇树科技中签者:刚要交别墅首付就打中,希望能赚20万装修费

对话宇树科技中签者:刚要交别墅首付就打中,希望能赚20万装修费

中新经纬
2026-08-18 15:58:02
5亿王者级肉签公布中签结果,打新收益高,股民中到注定吃大肉!

5亿王者级肉签公布中签结果,打新收益高,股民中到注定吃大肉!

数据挖掘分析
2026-08-21 08:06:59
4万吨烂发臭!菲律宾破防,叫嚣中国必须买单,反遭泰越联手绞杀

4万吨烂发臭!菲律宾破防,叫嚣中国必须买单,反遭泰越联手绞杀

攒一兜星星
2026-08-20 08:54:47
8月全员涨薪5%、补发1-7月工资?别再被虚假薪资消息误导

8月全员涨薪5%、补发1-7月工资?别再被虚假薪资消息误导

时尚的弄潮
2026-08-21 08:35:44
日军鼻子下留一撮毛,才不是为了时髦,你知道是什么意思吗?

日军鼻子下留一撮毛,才不是为了时髦,你知道是什么意思吗?

墨策讲历史
2026-08-20 21:05:12
微软在华最后一根钉子被拔!中国政企出手,提前清退Win10操作系统

微软在华最后一根钉子被拔!中国政企出手,提前清退Win10操作系统

一个有灵魂的作者
2026-08-19 15:25:07
日本对美国做法深表遗憾,俄外长要日本充分认真阅读的是啥?

日本对美国做法深表遗憾,俄外长要日本充分认真阅读的是啥?

新民周刊
2026-08-20 09:14:44
5000万镑买个伤员?利物浦这是急了还是疯了?布莱顿都笑了

5000万镑买个伤员?利物浦这是急了还是疯了?布莱顿都笑了

独坐山巅前
2026-08-21 07:34:02
远超比亚迪,暴赚3000亿!出口94万辆,这个国产汽车闷声发大财

远超比亚迪,暴赚3000亿!出口94万辆,这个国产汽车闷声发大财

瓦伦西亚月亮
2026-08-21 03:45:45
高雄市长选战支持谁?最新街头民调结果出乎意料

高雄市长选战支持谁?最新街头民调结果出乎意料

新时光点滴
2026-08-21 04:25:40
记者:高层给卡里克提供了3-4个中场,他认为巴莱巴最适配

记者:高层给卡里克提供了3-4个中场,他认为巴莱巴最适配

懂球帝
2026-08-20 23:42:08
17年邓小平弟弟去世,享年106岁,遗嘱:和哥哥一样骨灰撒入大海

17年邓小平弟弟去世,享年106岁,遗嘱:和哥哥一样骨灰撒入大海

老崔生活故事
2026-08-21 06:45:03
特朗普再爆桃色绯闻!知情人爆料:他只想和女助理一起坐专机旅行

特朗普再爆桃色绯闻!知情人爆料:他只想和女助理一起坐专机旅行

记得那片海辛
2026-08-20 14:20:50
李嘉诚旗下长和最新发声:寻求索偿超15亿美元

李嘉诚旗下长和最新发声:寻求索偿超15亿美元

看看新闻Knews
2026-08-20 19:03:27
油价上涨!一夜起飞,8月21日全国92,95汽油“预涨370元/吨”,今天涨幅“又多50元/吨”,下次8月28日调价,显著上涨中

油价上涨!一夜起飞,8月21日全国92,95汽油“预涨370元/吨”,今天涨幅“又多50元/吨”,下次8月28日调价,显著上涨中

猪友巴巴
2026-08-21 09:09:05
火炬大桥护栏立柱开裂,一掰水泥块就掉落?洛阳市发布情况说明

火炬大桥护栏立柱开裂,一掰水泥块就掉落?洛阳市发布情况说明

扬子晚报
2026-08-20 18:09:55
为什么詹姆斯晚年风评断崖式崩盘?绝非实力下滑,根源太现实

为什么詹姆斯晚年风评断崖式崩盘?绝非实力下滑,根源太现实

小徐讲八卦
2026-08-21 07:40:53
北京知识产权法院驳回LV诉求:LV老花源自宝相花、柿蒂纹,这些是中国千年传统纹样,属公共资源,任何品牌都无权独占垄断

北京知识产权法院驳回LV诉求:LV老花源自宝相花、柿蒂纹,这些是中国千年传统纹样,属公共资源,任何品牌都无权独占垄断

大风新闻
2026-08-20 22:35:04
朝鲜这份情,中国14亿人民记下了!澳大利亚曾经一个智库提醒日本

朝鲜这份情,中国14亿人民记下了!澳大利亚曾经一个智库提醒日本

果妈聊娱乐
2026-08-20 16:32:51
2026-08-21 09:56:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13803文章数 142724关注度
往期回顾 全部

科技要闻

快手Q2研发狂烧45亿:如何面对双面夹击

头条要闻

女游客深山突发脑梗 医护背10公斤设备徒步40分钟救人

头条要闻

女游客深山突发脑梗 医护背10公斤设备徒步40分钟救人

体育要闻

46岁小罗抵达意大利 将为拉文纳征战意丙

娱乐要闻

迪丽热巴与陈飞宇的恋情罗生门

财经要闻

包起号、包上榜 流量围城里的中小餐馆

汽车要闻

比总部还大?比亚迪藏在上海虹桥的巨无霸闪充站!

态度原创

数码
旅游
亲子
家居
公开课

数码要闻

消息称苹果重心转向智能眼镜:裁掉整个VR研发团队

旅游要闻

青海乌兰:茶卡盐湖“天空之镜”引客来

亲子要闻

孩子发育不好,要注意营养 孩子营养要全面,不然长不高

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版