网易首页 > 网易号 > 正文 申请入驻

何恺明团队首个语言模型:105M参数,不走GPT自回归老路

0
分享至

来源:市场资讯

(来源:图灵人工智能)


henry 发自 凹非寺

量子位 | 公众号 QbitAI


何恺明,也下场做语言模型了。

只不过,这次他带队做的不是大家熟悉的、像ChatGPT背后那套“预测下一个词元”(next token prediction)的自回归范式。

而是另一条过去几年在图像领域大火、如今正被越来越多人搬进文本生成的新路线:扩散语言模型(Diffusion Language Model,DLM)。

在最新的论文中,何恺明团队放出全新连续扩散语言模型:ELF:Embedded Language Flows。


与不少还停留在token层面做扩散的语言模型不同,ELF把整个生成过程都留在了连续的embedding空间里,直到最后一步,才重新离散化,将表示变回token。

靠着这套设计,ELF只用了105M参数、45B训练token、32步采样,就正面跑赢了一批主流扩散语言模型。

最直观的一项指标是它在OpenWebText上,把生成困惑度(Generative Perplexity)直接压到了24。

这里简单科普一下生成困惑度,它本质上是让一个强大的语言模型,给生成结果“检查作业”,看看这些文本到底像不像真实人类写出来的语料——

值越低,说明生成质量越高、模型出来的东西也就越没AI味儿,越自然。

在和主流扩散语言模型的对比中,ELF在训练token少近10倍、采样步数更少的情况下,反而拿到了更低的生成困惑度。


可以说,在过去很长一段时间里,扩散语言模型的进展,几乎都发生在离散DLM(Discrete DLM)这一侧。

而ELF第一次证明了一件事:连续的方法,不但能跑,而且效果不错。

ELF到底做了什么

要理解ELF,先得理解扩散语言模型现在到底在做什么。

扩散语言模型,主要有两种技术路线。一是以MDLM、Duo为代表的离散派,直接在token空间做扩散,每一步处理的是离散随机变量。

二是包括Diffusion-LM、CDCD、DiffuSeq在内的连续派,把token映成连续embedding,在连续空间里去噪。


此前的研究中,像MDLM、LLaDA、Dream 7B这些离散路线占据了上风。原因是很简单,因为语言本身就是离散的。

对于这一看似常识的理解,恺明团队给出的判断恰恰相反——

问题可能不是“语言必须离散”,问题可能是:前人根本没有让连续路线,连续到底。

Diffusion-LM这一类的方法虽然在embedding空间去噪,但每一步都要算一次token-level的交叉熵,把连续轨迹一路绑在词表上。

后来的LD4LG、Cosmos走latent diffusion路线,去噪过程是连续了,但要单独训一个decoder把latent解回token,相当于多一个模块。

基于此,ELF把所有denoising,全留在continuous embedding space;直到最后一步 t=1,才重新投回token。


具体来说,ELF在训练时,离散token先被编码成连续embedding,再加噪成 z_t,模型要么负责把它还原成干净embedding(MSE),要么直接预测token(CE)。


推理时,模型从高斯噪声 z_0 出发,一路在连续空间里去噪,直到最后一步,才切到decode模式,把embedding重新投回token。

ELF第一次把“连续表示”和“离散输出”这两个过去总被认为必须反复对齐的问题,彻底拆开了:

中间的去噪,完全交给连续空间;最终的语言生成,只留到最后一步离散化。

没有每一步都往词表上硬对齐,也不需要额外训练一个decoder,整个生成流程第一次真正做到了:

连续就是连续,离散就是离散。

而这,恰恰也是ELF后面能用更少采样步数、更少训练token,却跑赢一众扩散语言模型的关键。

ELF不是“先扩散,再解码”。

在具体的实现上,ELF还解决了三个问题:

token怎么变连续?连续里怎么去噪?最后又怎么变回token?

把token变成连续embedding

要把连续扩散用在语言上,第一步,得先把离散的token变成连续表示。

论文中,ELF先把它切成token序列,再映射到连续embedding空间。这里具体怎么映射,其实有多种选择。

默认情况下,ELF用的是T5预训练encoder,生成双向的contextual embedding。论文后面也测试了jointly trained embedding和随机embedding等不同方案。

值得注意的是,这个encoder只在训练阶段使用,推理时并不会额外增加模块。

在连续embedding空间里做Flow Matching

拿到连续表示之后,ELF就在embedding空间里做Flow Matching。

简单说,Flow Matching定义了一条从噪声到真实数据的连续流动轨迹:

  • t=0时,是高斯噪声;

  • t=1时,是干净的embedding;

  • 中间所有状态,都是两者的线性插值,也就是论文里的rectified flow。

在传统Flow Matching,网络通常直接预测“速度场” v。

但ELF没有这么做,而是沿用了恺明团队半年前在《Back to Basics: Let Denoising Generative Models Denoise》里提出的思路——

直接预测干净embedding x,也就是x-prediction。


训练目标,就是最小化预测embedding和真实embedding之间的均方误差(MSE)。


至于为什么采用x-prediction,论文给了两个原因:

第一,它在高维表示上更稳定——比如768维甚至更高的token embedding;第二,它天然和最后一步“预测干净token”的目标对齐。

论文还特别提到:虽然理论上也可以先预测速度v,再换算成x,但这样一来,后面denoising和decoding之间的权重共享就很难成立。

实验上,他们也发现:一旦共享权重,v-prediction效果明显变差。

从连续embedding,再回到离散token

生成语言,最终输出还是离散token。

所以ELF只在最后一个时间步(t = 1),还得把连续embedding重新投回token空间。

不过,这一步ELF没有像很多latent diffusion方法那样,额外训练一个decoder。相反,它把最后一步直接视作:一次continuous-to-discrete decoding。

换句话说:decoder和前面的denoiser,其实是同一个网络。

为了让最后一步训练不至于太简单(因为理论上t→1时,输入已经非常接近干净embedding),ELF在最后一步额外加入了一次token-level corruption,构造出一个带扰动的输入。

随后,同一个网络输出clean embedding,再通过一个可学习的unembedding矩阵 W,投影成token logits。

训练目标,则是标准的token-level cross-entropy loss。整个网络共享同一套参数,并额外接收一个二值的mode token:去噪模式/解码模式。

推理时,ELF从高斯噪声开始一路在连续空间里去噪,直到最后一步 t = 1,才切换到decode模式,再通过argmax输出最终token。

值得一提的是,在ELF中,图像生成里最常用的技术之一,CFG(classifier-free guidance)也被搬过来了

ELF用self-conditioning作为条件信号,套上training-time CFG(一次forward模拟两次推理,没有inference开销),把图像那边的方案直接搬了过来。

实验对比

实验部分,ELF基本回答了一个过去两年一直悬着的问题:

连续扩散语言模型,到底能不能打?答案是:不但能打,而且第一次在质量、速度、训练成本三个维度同时赢。

如开头所说,在OpenWebText生成任务中,在不做蒸馏的情况下,ELF只用32步采样,就把生成困惑度压到了24。

而此前主流的离散扩散模型,往往要跑到1024步,才能接近这个水平。


更夸张的是,ELF实现这一结果时,训练token只用了45B。

而同级别对手,普遍是500B+。换句话说:采样步数少了一个数量级,训练数据也少了一个数量级,效果反而更好。

而在很多扩散模型最容易掉队的条件生成任务上,ELF也没掉链子。

无论是WMT14机器翻译,还是XSum文本摘要,ELF都稳定超过现有扩散语言模型,甚至把不少自回归baseline也压了下去。


论文最后给出的总结其实很克制:ELF在生成质量、采样效率和训练成本之间,实现了很强的trade-off。

翻译成人话就是:连续派,不是不能打。只是以前没把连续这件事做到底。

作者介绍

最后,我们再来介绍一下这篇文章的作者。

这篇论文的两篇一作是共同贡献,排名先后顺序由硬币决定。

胡珂雅,她是这篇文章的两位第一作者之一,MIT EECS一年级博士生,也是恺明在MIT带的第一批博士生之一,目前由恺明和Jacob Andreas联合指导。


图源:胡珂雅个人主页

她本科毕业于上交的ACM班,目前的研究兴趣主要是语言和视觉的交叉领域,致力于构建数据效率更高、泛化能力更强的智能体。

值得一提的是,在恺明MIT的主页中,胡珂雅排在Grad students第一位,可以说是组内的大师姐了。


第二位第一作者Linlu Qiu,同样是MIT的博士生,师从Yoon Kim。


图源:Linlu Qiu个人主页

她本科毕业于香港大学,硕士毕业于Georgia Institute of Technology,此前还在Google做过AI Resident。

有意思的是,这并不是她第一次和恺明合作。就在不久前,她还和恺明团队一起拿下了CVPR 2026论文《ARC Is a Vision Problem!》,把ARC推理问题重新定义成了视觉问题。


另一位作者Hanhong Zhao(赵瀚宏)为MIT本科生,他高中就读于人大附中,曾是国际物理奥林匹克竞赛IPhO金牌得主。


△图源:math.mit.edu

还有一位作者陆伊炀,背景有点“少年班味道”。


图源:陆伊炀个人主页

他是清华姚班大二本科生,目前在MIT计算机科学与人工智能实验室(CSAIL)实习,导师是何恺明,主要研究方向为计算机视觉和深度生成模型。

高中时期,他是物理竞赛生,曾以江苏选手中第一名、全国第九名的成绩,在2022年获得了第三十九届全国中学生物理竞赛(CPhO)金牌。

此前,他以一作身份与恺明合作过论文《Bidirectional Normalizing Flow: From Data to Noise and Back》。


另一位核心作者黎天鸿,则是恺明组的博后。


图源:黎天鸿个人主页

他本科就读于清华姚班,博士毕业于MIT,半年前那篇《Back to Basics: Let Denoising Generative Models Denoise》的一作,就是他。

此外,论文的其他作者Yoon Kim、Jacob Andreas,MIT EECS两位语言模型方向的教授,以及何恺明本人。

[1]https://arxiv.org/pdf/2605.10938

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美财长当众喊话:中国必须选边站,不到24小时,中方回应一针见血

美财长当众喊话:中国必须选边站,不到24小时,中方回应一针见血

霁寒飘雪
2026-08-22 12:08:13
许家印之前有多奢靡?一年抽雪茄花费700万,专属进口矿泉水水温每半个小时测一次

许家印之前有多奢靡?一年抽雪茄花费700万,专属进口矿泉水水温每半个小时测一次

Mr王的饭后茶
2026-08-20 21:41:41
TVB前男星张致恒太太再诉苦!两个儿发烧家中被断电!怒轰不争气老公:凭什么混娱乐圈

TVB前男星张致恒太太再诉苦!两个儿发烧家中被断电!怒轰不争气老公:凭什么混娱乐圈

我爱追港剧
2026-08-22 11:55:57
不再保持中立,东盟国家密集“选边站”,台海叙事正在被彻底改写

不再保持中立,东盟国家密集“选边站”,台海叙事正在被彻底改写

麓谷隐士
2026-08-22 08:08:44
戴安娜弟弟高调出书爆猛料!姐姐离婚时,是亲弟弟亲手关上家门

戴安娜弟弟高调出书爆猛料!姐姐离婚时,是亲弟弟亲手关上家门

一口娱乐
2026-08-20 06:06:47
市场被《牛来》反噬,新片集体扑街,最惨一部票房325元

市场被《牛来》反噬,新片集体扑街,最惨一部票房325元

光影新天地
2026-08-21 16:08:40
40万亿美元!美国国债爆表,上半年利息就还了5290亿美元,比军费还高!平均每名美国人背负约11.6万美元债务 美国人平均背债11.6万美元

40万亿美元!美国国债爆表,上半年利息就还了5290亿美元,比军费还高!平均每名美国人背负约11.6万美元债务 美国人平均背债11.6万美元

每日经济新闻
2026-08-21 23:06:57
中国“最糙动画”电影《牛来》火出国门?到了日本网友嘴里,画风突然变了...

中国“最糙动画”电影《牛来》火出国门?到了日本网友嘴里,画风突然变了...

今日日本
2026-08-19 13:36:00
郑州前市长何雄的“小困难”与“保交楼”。

郑州前市长何雄的“小困难”与“保交楼”。

乐天WMQ
2026-08-21 18:08:30
李小冉喜提奔驰大G:她终于活成了那个“不好惹”的样子

李小冉喜提奔驰大G:她终于活成了那个“不好惹”的样子

乡野小珥
2026-08-22 13:39:17
电影《牛来》票房突破3300万!细心的网友发现,并非“零宣发”,导演信雨萌在其微信朋友圈做了宣发

电影《牛来》票房突破3300万!细心的网友发现,并非“零宣发”,导演信雨萌在其微信朋友圈做了宣发

火山詩话
2026-08-21 11:45:34
若24枚东风41一齐发射,号称世界第一的美国,是否有能力拦住呢?

若24枚东风41一齐发射,号称世界第一的美国,是否有能力拦住呢?

明天见灌装冰块
2026-08-22 02:22:31
销量大涨,方便面为什么又香了?

销量大涨,方便面为什么又香了?

无相商业趋势
2026-08-20 08:54:02
未来乒坛的顶级男单宝座,会被以下五人持续统治!但关键弱点都可能成为下一个翻盘契机

未来乒坛的顶级男单宝座,会被以下五人持续统治!但关键弱点都可能成为下一个翻盘契机

林子说事
2026-08-22 08:47:18
被立案调查9天,53岁郭德纲再迎噩耗

被立案调查9天,53岁郭德纲再迎噩耗

叨唠
2026-08-21 02:22:23
中铁成都局回应“旅客买票占座放零食”

中铁成都局回应“旅客买票占座放零食”

界面新闻
2026-08-21 20:57:29
朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

人生录
2026-08-13 00:05:10
冯小刚花60万给女儿徐朵整牙,最后扔下一句:骨相不行,别演戏了

冯小刚花60万给女儿徐朵整牙,最后扔下一句:骨相不行,别演戏了

西楼知趣杂谈
2026-08-19 21:12:47
英超新闻:央视周末直播英超两次比赛 | 曼城的比赛有CCTV5 直播

英超新闻:央视周末直播英超两次比赛 | 曼城的比赛有CCTV5 直播

80后体育大蜀黍
2026-08-21 21:57:50
九号电动车一年后智能服务续费66元/年,全国多地车主称“被套路”,记者暗访16家门店仅4家主动告知,律师:涉嫌侵害知情权

九号电动车一年后智能服务续费66元/年,全国多地车主称“被套路”,记者暗访16家门店仅4家主动告知,律师:涉嫌侵害知情权

山西经济日报
2026-08-21 11:09:58
2026-08-22 14:35:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4512567文章数 9341关注度
往期回顾 全部

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

头条要闻

男子出轨和保险女业务员开房180多次 投上千万买保险

头条要闻

男子出轨和保险女业务员开房180多次 投上千万买保险

体育要闻

枪手赚翻!4000万新援揭幕战8分钟策动2球

娱乐要闻

赵丽颖冯绍峰,打了内娱离婚夫妻的脸

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

全栈自研控本不降质 22.68万解锁魏牌旗舰实力

态度原创

房产
健康
亲子
教育
时尚

房产要闻

两大热盘即将入市!三亚又一批安居房狠货要炸场了!

“矫正神器”真能治好脊柱侧弯吗?

亲子要闻

“妈妈,你每次带我去查眼睛,我都很紧张”

教育要闻

“妈妈毁掉女儿月薪9k的工作”,多少父母,正在亲手毁掉孩子的人生

从追星到追光,年轻女性的消费逻辑又变了

无障碍浏览 进入关怀版