网易首页 > 网易号 > 正文 申请入驻

Meta AI技术负责人:关于蒸馏的五个误区

0
分享至


我最近看到 X 上关于 AI 蒸馏(Distillation)流传着不少误解。

这些观点通常来自两个阵营:一方把它描述成一场“模型劫案”,另一方则认为“根本没什么值得关注的”。

我这里不对任何一方的具体行为发表评论,只是纠正一些关于蒸馏的常见误区。

误区一:“蒸馏就是偷走一个模型”

蒸馏是一种训练方法。

在大语言模型(LLM)领域,学生模型(student)可以从教师模型(teacher)的回答、token 概率、排序结果、偏好信息或判断结果中学习。

这种机制可以用于同一家实验室内部、不同机构之间基于授权或合同合作,以及未经授权的情况下使用。

蒸馏技术已经存在十多年,最初被广泛用于将大型系统的能力压缩到更小、更便宜的模型中。

如今,各大实验室都会使用蒸馏以及相关的合成数据技术,来构建成本更低或更专业化的 AI 模型。

还有一个更微妙的现实是,随着越来越多互联网内容由 AI 生成或编辑,新一代模型越来越多地训练于上一代模型产生的输出之上。

这严格来说并不属于技术意义上的“知识蒸馏”(knowledge distillation),但它确实形成了一种广泛存在的“模型之间能力迁移”,即使没有明确的教师-学生训练流程。

因此,“蒸馏”只能说明能力可能通过某种方式发生了转移。

它本身并不能证明是否有人进行了模型窃取。

误区二:“几百万次对话太少,不可能产生影响”

单纯从数据量来看,一些蒸馏行为确实看起来规模太小,似乎不足以产生影响。

假设每次对话包含 1000~4000 个 token、1600 万次对话,那么总量大约是160 亿~640 亿 token。

相比公开资料中的前沿模型训练规模,例如 Llama 3 405B 使用超过 15 万亿 token,这只占约 0.1%~0.4%。

但训练过程并不是把所有数据均匀混合在一起的一锅“汤”。

小规模数据在某些阶段可能拥有极高杠杆作用。

第一,后期训练阶段

在退火(annealing)阶段以及针对性的中期训练阶段,部分数据会被刻意提高权重,而不是简单均匀混入整个训练过程。

例如,在 Meta 对 Llama 3 的数据质量实验中一个 8B 模型进行了 400 亿 token 的退火训练,其中候选高质量数据占训练混合比例的 30%。

Meta 报告显示, GSM8K 数学测试提升 24.0%,MATH 测试提升 6.4%。

不过,在 405B 大模型上,收益几乎可以忽略。

这说明小规模高质量数据确实可能有效,但这种效果并不会随着模型规模线性扩大。

第二,强化学习启动阶段(RL bootstrapping)

DeepSeek-R1 在第一次面向推理能力的强化学习阶段之前,使用了数千条冷启动样本。

但简单说“强化学习完成了一切”是不准确的。

完整流程后来还加入约 80 万条监督微调样本,及另一阶段强化学习。

同时,它的伴随模型 R1-Zero 展示了即使没有监督冷启动数据,仅靠强化学习,也可以涌现出较强推理能力。

第三,训练评估器(judge)

教师模型并不一定直接提供训练文本。

它可以给答案打分、对多个答案排序,及评价网页质量。

这些标签随后可以训练奖励模型、分类器、数据过滤器。

这些系统又会影响规模大得多的数据。

也就是说,迁移的不一定是文本,而可能是判断标准、偏好和品味。

所以现实情况是,小规模数据如果处于正确的位置,可能成为整个训练流程中的关键变量。

误区三:“从模型输出可以看出来,学生模型会暴露教师模型”

这一点很难成立。

一些明显证据,例如模型直接说“我是某某公司的模型”,在经过改写、混合、转换成评分信号之后,很容易消失。

一个成熟的训练流程可能会先用本地模型重新表达教师模型回答,将数据稀释到更大的混合数据集中,或者只把教师模型用于评分,而完全不保留原始文本。

目前我也没有看到任何已经在生产环境部署、并且被证明能够在完整训练流程中存活的模型输出水印技术。

误区四:“他们正在用大量采集的模型输出填充训练数据”

预训练数据规模通常是万亿 token 级别。万亿 token 规模的合成数据集,通常不是通过调用某个模型 API 填满整个训练过程。

更常见的方法是,利用中等规模模型,对开放互联网数据进行转换。

例如NVIDIA 的 Nemotron 项目将 Common Crawl 转换成一个包含6.3 万亿 token、其中 1.9 万亿 token 为合成生成内容的数据集。

它使用 Mistral NeMo 12B 进行大规模生成,包括Wikipedia 风格改写、问答生成、蒸馏、知识提取等。

计算一下,如果每次 API 调用输出 1000 token,生成 1 万亿 token,需要约10 亿次调用。

生成 15 万亿 token,则需要150 亿次调用。

因此,这并不排除有针对性的采集行为。

但它反驳了一种简单化想象,即某家公司通过 API 获取大量回答,然后直接组成一个前沿模型全部训练数据。

更现实的例子是 FineWeb-Edu。

研究人员让 Llama 3 70B 给 46 万个网页进行教育质量评分,然后用这些评分训练线性回归模型,再将评分推广到 FineWeb 的 15 万亿 token 数据,筛选出 1.3 万亿 token 的教育数据子集。

实验显示,FineWeb-Edu 在多个知识和推理相关基准测试中,超过了他们比较的其他公开网页数据集。

误区五:“我们知道能力到底转移了多少”

目前我没有看到一种方法,或者充分证据,可以准确衡量蒸馏到底贡献了多少能力。

打个比方,老师给学生 1000 道例题。之后学生独自练习 100 万道题,最后考试满分。

那么,多少功劳属于老师?多少属于学生?多少属于练习过程?很难拆分。

现有研究显示了多个方向,一方面,有证据表明带有可验证奖励的强化学习,主要是在让基础模型中已经潜在存在的能力更容易被激活。

另一方面,也有证据显示,教师指导的课程式强化学习,可以扩大模型表现出来的推理边界。

还有一些蒸馏实验表明,可以转移教师模型拥有、但学生模型仅靠原始奖励信号无法获得的信息。

因此,讨论 AI 蒸馏时,更值得关注的问题不是“有没有蒸馏?”而是到底转移了什么?

是答案、推理过程、偏好,还是评分标准?发生在哪个阶段?规模有多大?

这些问题,才是真正决定蒸馏影响程度的关键。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
研究证实:人体强壮的秘密,根本不是肌肉!而是这四个东西

研究证实:人体强壮的秘密,根本不是肌肉!而是这四个东西

牛锅巴小钒
2026-08-09 01:58:26
孙子考上武大,黑龙江大爷摆35桌升学宴,结果只来不到两桌人!网友:这礼收得有点尴尬

孙子考上武大,黑龙江大爷摆35桌升学宴,结果只来不到两桌人!网友:这礼收得有点尴尬

听心堂
2026-08-13 07:10:32
只剩半天时间了!曼城即将开启对恩佐求购,1.2亿欧元贵不贵

只剩半天时间了!曼城即将开启对恩佐求购,1.2亿欧元贵不贵

里芃芃体育
2026-08-14 09:50:15
火箭50胜概率仅33% 背靠背14场难度较大 38岁杜兰特将失统治力?

火箭50胜概率仅33% 背靠背14场难度较大 38岁杜兰特将失统治力?

颜小白的篮球梦
2026-08-14 10:57:36
美财长天塌了,中国7800亿美债换成人民币结算,美这哑巴亏吃定了

美财长天塌了,中国7800亿美债换成人民币结算,美这哑巴亏吃定了

心灵得以滋养
2026-08-13 10:32:18
马卡报曝贝林厄姆回皇马将踢10号位,穆帅:他令我想起兰帕德

马卡报曝贝林厄姆回皇马将踢10号位,穆帅:他令我想起兰帕德

画夕
2026-08-14 01:34:20
下体被捅2尺木棍,军嫂被害,内参惊动中央,江苏特大杀人案始末

下体被捅2尺木棍,军嫂被害,内参惊动中央,江苏特大杀人案始末

易玄
2026-08-07 12:39:42
“美国英雄”将认罪!预计将会获得轻判

“美国英雄”将认罪!预计将会获得轻判

大洛杉矶LA
2026-08-14 05:57:33
震惊!邹市明发声称冉莹颖没有亲哥,“保安队长”只是7岁孩童,网友:这个声明,是不是别人用他账号发的

震惊!邹市明发声称冉莹颖没有亲哥,“保安队长”只是7岁孩童,网友:这个声明,是不是别人用他账号发的

火山詩话
2026-08-14 09:57:14
爆冷!10人中国足球小将1-1平9人巴萨 吕孟洋破门 董路狂喜发奖金

爆冷!10人中国足球小将1-1平9人巴萨 吕孟洋破门 董路狂喜发奖金

念洲
2026-08-14 06:55:21
罗马诺丨here we go,米兰拿满1400万浮动

罗马诺丨here we go,米兰拿满1400万浮动

米兰圈
2026-08-14 08:53:28
10天后2台风生成,17号台风“浪卡”,浙江一地局地暴雨、大暴雨

10天后2台风生成,17号台风“浪卡”,浙江一地局地暴雨、大暴雨

艺利森
2026-08-14 10:43:15
微软下最后通牒:2027年全面封杀短信验证码,数亿用户需紧急行动

微软下最后通牒:2027年全面封杀短信验证码,数亿用户需紧急行动

野生运营
2026-08-13 18:28:58
男篮“进攻便秘”解决了?三分暴涨+球风蜕变,只因少了此人?

男篮“进攻便秘”解决了?三分暴涨+球风蜕变,只因少了此人?

弄月公子
2026-08-14 07:41:57
俄国认为:《尼布楚条约》是耻辱,黑龙江流域自古就是他们的领土

俄国认为:《尼布楚条约》是耻辱,黑龙江流域自古就是他们的领土

浔阳咸鱼
2026-08-11 17:15:07
中美航发差距又扩大?涡扇15推力、油耗和高速性能都比不过XA100

中美航发差距又扩大?涡扇15推力、油耗和高速性能都比不过XA100

阿振观点
2026-08-13 05:38:59
重磅反转!皇马天才主动示好曼联!世界级超新星或空降梦剧场

重磅反转!皇马天才主动示好曼联!世界级超新星或空降梦剧场

澜归序
2026-08-14 09:46:23
定了!森林狼将在明年3月1日退役加内特球衣 主场对阵绿军意义非凡

定了!森林狼将在明年3月1日退役加内特球衣 主场对阵绿军意义非凡

罗说NBA
2026-08-14 06:08:36
以后可能没有铁饭碗了,网传体制内已裁120万人

以后可能没有铁饭碗了,网传体制内已裁120万人

互联网大观
2026-08-10 15:16:40
西安事变没杀蒋,有人说可惜,真杀了,中国可能连37年都撑不到

西安事变没杀蒋,有人说可惜,真杀了,中国可能连37年都撑不到

纪史行者
2026-08-13 20:59:10
2026-08-14 12:07:00
AI先锋官 incentive-icons
AI先锋官
AIGC大模型及应用精选与评测
630文章数 102关注度
往期回顾 全部

科技要闻

DeepSeek大招:开发者狂喜 普通人用不明白

头条要闻

父亲来杭州养老走失14小时 女儿找了1夜哭着憋出3个字

头条要闻

父亲来杭州养老走失14小时 女儿找了1夜哭着憋出3个字

体育要闻

威少已下线,带走一份真

娱乐要闻

郭德纲会犯这种错,是因为被捧的太高

财经要闻

梁文锋,开始算账了

汽车要闻

售14.38万元 方程豹钛3 510KM后驱闪充版上市

态度原创

家居
艺术
教育
数码
时尚

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

朱镕基逝世

教育要闻

中考数学:难住不少中学生,小学生轻松破解

数码要闻

不到1公斤的谷歌笔记本!华硕首款机型曝光

这4种版型的牛仔裤,真的很好穿!

无障碍浏览 进入关怀版