网易首页 > 网易号 > 正文 申请入驻

大语言扩散模型来了,何必只预测下一个token | 人大高瓴&蚂蚁

0
分享至

明敏 发自 凹非寺
量子位 | 公众号 QbitAI

用扩散模型替代自回归,大模型的逆诅咒有解了!

人大高瓴人工智能研究院、蚂蚁共同提出LLaDA(a Large Language Diffusion with mAsking)。

LLaDA-8B在上下文学习方面与LLaMA3-8B能力相当,而且在反转诗歌任务中超越GPT-4o。

在大语言模型领域,反转诗歌是一个特殊任务,它用来评估模型在处理语言模型的双向依赖关系和逻辑推理能力。

比如让大模型写出“一行白鹭上青天”的上一句。

通常情况,自回归模型(如GPT)根据下文推断上文的表现上总是不够好。这是因为自回归模型的原理就是利用序列中前面的元素来预测当前元素,即预测下一个token。

而LLaDA是基于扩散模型的双向模型,天然能够更好捕捉文本的双向依赖关系。

作者在摘要中表示:LLaDA挑战了LLMs关键能力与自回归模型之间的固有联系。

这些研究也引发了不少讨论。

有人提出:

我们正在重构掩码语言模型建模?

RAG和嵌入式相似性搜索上,这种范式也可能表现更好?

值得一提的是,LLaDA仅用13万H800GPU时训练了2.3万亿token语料,然后对450万对token进行SFT。

正向掩码+反向预测

论文核心提出了一个问题:自回归是否是实现LLMs智能的唯一路径?

毕竟自回归范式的LLMs目前仍存在诸多弊端,比如逐个生成token的机制导致计算成果很高,从左到右建模限制了逆推理任务中的性能。

这都限制了了LLMs处理更长、更复杂任务的能力。

为此,他们提出了LLaDA。通过正向掩码和反向预测机制,让模型更好捕捉文本的双向依赖关系。

研究采用标准的数据准备、预训练、监督微调(SFT)和评估流程,将LLaDA扩展到80亿参数。

在2.3万亿token上从零开始预训练,使用13万H800 GPU时,随后在450万对数据上进行监督微调。

在语言理解、数学、代码和中文等多样化任务中,表现如下:

强大可扩展性:LLaDA 能够有效扩展到10²³ FLOPs计算资源上,在六个任务(例如MMLU和GSM8K)上,与在相同数据上训练的自建自回归基线模型结果相当。

上下文学习:值得注意的是,LLaDA-8B 在几乎所有 15 个标准的零样本/少样本学习任务上都超越了 LLaMA2-7B,并且与 LLaMA3-8B表现相当。

指令遵循:LLaDA在SFT后显著增强了指令遵循能力,这在多轮对话等案例研究中得到了展示。

反转推理:LLaDA有效地打破了反转诅咒,在正向和反转任务上表现一致。特别是在反转诗歌完成任务中,LLaDA 的表现优于 GPT-4o。

LLaDA使用Transformer架构作为掩码预测器。与自回归模型不同,LLaDA的transformer不使用因果掩码(Causal Mask),因此它可以同时看到输入序列中的所有token。

模型参数量与传统大语言模型(如GPT)相当,但架构细节(如多头注意力的设置)略有不同,以适应掩码预测任务。

正向掩码过程如下:

LLaDA采用随机掩码机制,对一个输入序列x0,模型会随机选择一定比例的标记进行掩码(masking),生成部分掩码的序列xt。

每个token被掩码的概率为t,其中t是从[0,1]中均匀采样的。这与传统的固定掩码比例(如BERT中的15%)不同,LLaDA的随机掩码机制在大规模数据上表现出更好的性能。

模型的目标是学习一个掩码预测器,能够根据部分掩码的序列xt预测出被掩码的token。训练时,模型只对被掩码的token计算损失。

其中1[·]是指示函数,表示只对被掩码的token计算损失。

在SFT阶段,LLaDA使用监督数据(如对话对、指令-响应对)进一步优化模型,使其在特定任务上表现更好。

对于每个任务,模型会根据任务数据的特点进行微调。例如在对话生成式任务中,模型会学习如何根据给定对话历史生成合适响应。

在SFT阶段,模型会根据任务数据的特点选择性地掩码响应部分token,这使得模型能够更好地学习任务相关的模式。

推理部分,在生成任务中,LLaDA通过反向采样过程生成文本。从一个完全掩码的序列开始,逐步预测出被掩码的token,直到生成完整的文本

采样过程中,LLaDA采用多种策略(如随机重掩码、低置信度重掩码、半自回归重掩码)来平衡生成效率和质量。

在条件概率评估任务中,LLaDA会根据给定的提示(prompt)和部分掩码的响应(response)来评估模型的条件概率。这使得LLaDA能够在各种基准任务上进行性能评估。

预训练LLM在不同基准上的表现如下。

后训练后在不同benchmark上的表现如下。其中LLaDA只进行了SFT,其他模型有进行额外的强化学习对齐。

在反转诗歌任务中,LLaDA超越了GPT-4o。

在多轮对话任务中LLaDA的表现如下,较深颜色表示采样后期阶段预测的token,较浅颜色表示在采样早期预测的token。

网友:期待能被真正用起来

研究团队同时放出了一些LLaDA的实际表现。

可以解决普通的数学推理问题。

编程问题也OK。

有国外网友表示:这肯定会推动中国AI研究更加关注小模型。不过也不代表他们放弃scaling。

同时也有人评价说,这或许可以开启一些混合模型的可能。

以及有人提及Meta也有过类似的工作,将transformer和diffusion相结合。

当然也有人关心,此前也提出了不少超越Transformer的架构,但是它们都还没有被学术界/工业界真正采纳。

让我们期待后续吧。

本项研究由人大高瓴人工智能学院与蚂蚁集团共同带来。通讯作者为李崇轩,他目前为人大高瓴人工智能学院准聘副教授,目前focuses的方向为深度生成模型,了解现有模型的能力和局限,设计有效且可扩展的下一代模型。

论文地址:
https://arxiv.org/abs/2502.09992
项目主页:
https://ml-gsai.github.io/LLaDA-demo/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
西方国家为什么都不喜欢中国?英国专家:中国有一个"老问题"

西方国家为什么都不喜欢中国?英国专家:中国有一个"老问题"

蜉蝣说
2026-07-29 10:38:37
韩媒:西班牙前主帅莫雷诺有意执教韩国;3年前他就曾被韩国足协考虑

韩媒:西班牙前主帅莫雷诺有意执教韩国;3年前他就曾被韩国足协考虑

懂球帝
2026-07-29 03:05:31
周继红现状:退休享受生活,与世界冠军丈夫很恩爱,儿子长大成人

周继红现状:退休享受生活,与世界冠军丈夫很恩爱,儿子长大成人

白面书誏
2026-07-28 20:11:14
5800万年轻人不交社保了:断缴的不是懒惰,是生存的算术

5800万年轻人不交社保了:断缴的不是懒惰,是生存的算术

互联网大观
2026-07-21 10:03:18
美军快速调遣兵力,航母持续抵近中国,禁航区已划,中方准时行动

美军快速调遣兵力,航母持续抵近中国,禁航区已划,中方准时行动

风信子的花
2026-07-29 11:56:13
方媛现身安徽老家,又矮又壮,素颜不如路人,一人吃8个菜引争议

方媛现身安徽老家,又矮又壮,素颜不如路人,一人吃8个菜引争议

孤城落日
2026-07-28 21:17:46
王虹、邓煜为何不回国搞研究?同门师兄许晨阳的经历或可作参考!

王虹、邓煜为何不回国搞研究?同门师兄许晨阳的经历或可作参考!

阿纂看事
2026-07-29 13:43:49
63亿!长沙这所大学整体搬迁!即将开工!

63亿!长沙这所大学整体搬迁!即将开工!

星耀长沙
2026-07-28 21:53:32
广东一男子家里地砖异常发热,最高温度飙到46.9℃!他求助网友后被提醒可能是漏电

广东一男子家里地砖异常发热,最高温度飙到46.9℃!他求助网友后被提醒可能是漏电

环球网资讯
2026-07-29 08:22:09
再打下去可能灭国,4年前乌克兰还有4300多万人,如今还有多少?

再打下去可能灭国,4年前乌克兰还有4300多万人,如今还有多少?

麓谷隐士
2026-07-28 06:05:03
苦寻亲生母亲几十年无果!他绝望中随手问了问AI,竟找到了失散半个世纪的家人…

苦寻亲生母亲几十年无果!他绝望中随手问了问AI,竟找到了失散半个世纪的家人…

英国那些事儿
2026-07-29 00:16:48
冯德莱恩公开摊牌,中方如果不作出让步,欧盟将对华采取报复措施

冯德莱恩公开摊牌,中方如果不作出让步,欧盟将对华采取报复措施

菁菁子衿
2026-07-29 09:53:48
江青墓地简陋寒酸:看了碑文,就能明白李讷的苦心和无奈

江青墓地简陋寒酸:看了碑文,就能明白李讷的苦心和无奈

诗意世界
2025-05-21 09:00:02
王励勤动真格!瑞典大满贯名单曝光,王楚钦缺席,2大王牌回归

王励勤动真格!瑞典大满贯名单曝光,王楚钦缺席,2大王牌回归

午夜搭车a
2026-07-29 13:06:01
为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

椰青美食分享
2026-07-28 13:25:32
直击青训痛点!黄健翔点评:练得多没用,训练方式早已走入误区

直击青训痛点!黄健翔点评:练得多没用,训练方式早已走入误区

小犙拍客在北漂
2026-07-29 08:22:22
邹市明为省钱搬到昆山,儿子在上海读书,如今现状老母亲早有预兆

邹市明为省钱搬到昆山,儿子在上海读书,如今现状老母亲早有预兆

林雁飞
2026-07-28 14:51:29
全球仅99件,售价455欧元!《生化危机:安魂曲》格蕾丝1:4手办发布

全球仅99件,售价455欧元!《生化危机:安魂曲》格蕾丝1:4手办发布

山月不知2
2026-07-28 18:03:47
贝内特重磅声明:当选总理即宣布卡塔尔为敌国

贝内特重磅声明:当选总理即宣布卡塔尔为敌国

落梅如雪乱飞
2026-07-29 15:13:26
医疗界大地震!不出意外的话,2026年起我国的医院将迎来全面洗牌

医疗界大地震!不出意外的话,2026年起我国的医院将迎来全面洗牌

白宸侃片
2026-07-27 12:08:28
2026-07-29 16:28:49
量子位 incentive-icons
量子位
追踪人工智能动态
13046文章数 176523关注度
往期回顾 全部

科技要闻

为什么要做增程车?雷军,最新回应

头条要闻

亲历熊本7.1级地震中国留学生:华人互助转运受困同胞

头条要闻

亲历熊本7.1级地震中国留学生:华人互助转运受困同胞

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

吴镇宇儿子自曝小学时遭同学霸凌

财经要闻

天丝红牛多地检出成分不合格 企业申诉

汽车要闻

24K金LOGO,纯手工打磨腰线,第二代腾势D9暗夜鎏金高定色,一天只能造3台?

态度原创

教育
亲子
游戏
数码
公开课

教育要闻

高中英语极易望文生义的动词短语:“pass away”不是“经过”而是“去世”!真题解析+巩固练习

亲子要闻

感冒诱发肺炎,“未来星”保障门诊和住院

卡普空高管称萝莉神作《识质存在》极大概率有续作

数码要闻

DDR4拖后腿了!英特尔平台DDR4/DDR5性能实测:最大差25.3%

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版