网易首页 > 网易号 > 正文 申请入驻

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

0
分享至

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。



先看成绩:在 Qwen-Image-Bench 上,LLaDA-Image 的英文、中文总分分别达到,在技术报告列出的开源模型中拿下双榜第一。



Qwen-Image-Bench 中英文综合成绩。模型按两条轨道的平均分排序;LLaDA-Image 在报告列出的开源模型中取得中英文双榜第一。

榜单给出了它在主流模型中的量化坐标。再回到最直观的生成效果,先来做一道 “真假图片” 判断题。

下面这组图里,哪些是真实照片?



人物、动物、食物与风景等 LLaDA-Image 生成样例。

答案是:一张也没有

更关键的是,为这个 6B DiT 建立视觉先验时,团队没有把 caption 作为预训练条件:2.2 亿累计生成训练样本中,超过 90% 采用纯图片监督

从林间抓拍、家庭照片和街边市场,到雪山、洞穴与中式园林,这些看似来自手机或相机的画面,全部由同一个模型生成。换到海报、广告和中英文排版,它又能给出下面这样的结果:



LLaDA-Image 的海报、文字渲染、艺术与设计类生成样例,展示模型覆盖多种视觉创作任务的定性效果。

这套模型来自 Inclusion AI,名为LLaDA-Image。其核心是一套从零训练的6B 参数 Diffusion Transformer(DiT),一套权重统一支持文生图和指令图像编辑;进一步蒸馏得到的 LLaDA-Image-Turbo,只需2—4 个采样步

真正让这项工作显得不一样的,是它重新回答了一个基础问题:训练高质量文生图模型,图文对一定要从预训练第一天就上场吗?

LLaDA-Image 给出的答案是:可以先从图片本身建立视觉生成先验,再在后续 SFT 中使用经过描述与一致性检查的图文对完成语言对齐。换句话说,先学会画,再学会听话

这条路线从纯图片预训练一路延伸到语言对齐、统一生成 — 编辑训练和少步蒸馏。生成训练各阶段累计处理约 2.2 亿个样本,最终交出了开篇榜单所示的中英文双榜开源第一成绩。

  • GitHub:github.com/inclusionAI/LLaDA-Image
  • 模型:https://huggingface.co/collections/inclusionAI/llada-image
  • 魔搭:https://modelscope.cn/collections/inclusionAI/LLaDA-Image
  • arxiv:https://arxiv.org/pdf/2609.03796

后端和生成都是扩散模型

LLaDA-Image 采用从理解到生成的全扩散架构:理解侧使用LLaDA2.0-mini,这是一款拥有 16B 总参数、激活 1B 参数的混合专家(MoE)扩散语言模型(dLLM),负责理解指令;生成侧使用从零训练的 6B DiT,负责将理解结果转化为图像。同一套系统可同时支持文生图和指令图像编辑。

图文对,可能并不是生成训练的 “入场券”

传统文生图路线通常从训练早期就把图片与文字说明绑定在一起。要让配对数据达到训练要求,还需要生成或人工补充详细 caption,并经过幻觉检测、文字转录校验和图文一致性过滤。

LLaDA-Image 换了一种分工:预训练和中期训练不把 caption 作为条件,而是由图像自身产生条件信号;到了需要语言监督的 SFT 阶段,再引入图文对完成文本 — 视觉对齐。报告显示,团队在这一阶段使用 Qwen3.6-35B-A3B 和 Qwen3-VL-235B-A22B-Instruct 为图像生成描述,并进一步校验物体、属性、关系与文字转录。

在这套分工里,两类数据被放到了各自更擅长的位置。原始图像保留材质、光影、局部结构和小物体等完整视觉信息;文本描述则擅长提炼语义,把自然语言概念接入已经形成的视觉空间。

纯图片负责建立视觉世界,图文对负责把语言接入这个世界。

尤其在早期低分辨率训练中,直接从实际裁剪区域提取条件,可以让条件与 256 X 256 的训练目标天然对应,并保留更多有效细节。于是,未经文本配对的图片也能直接参与吞吐量最大的视觉学习阶段,高质量配对资源则集中用于后续语言对齐。

这套分工也对应着一种更灵活的数据组织方式:先让图片直接参与视觉学习,再把配对数据集中配置到语言对齐阶段。

完整流程可以概括为六个阶段:



这里的关键,是前两个生成阶段直接从图像自身获得条件信号。从方法接口看,图像通过基础质量筛选后即可参与预训练和中期训练;大模型 captioning 与图文对齐管线则在后续 SFT 阶段发挥作用。

一张图,同时提供 “题目” 和 “答案”

给定一张训练图片,系统先用冻结的 SigLIP-VQ 视觉编码器把它变成图像 token,再随机遮掉其中一部分。保留下来的稀疏视觉 token 与一条固定辅助指令一起进入冻结的多模态理解模型,形成 DiT 的条件;完整图片的 VAE 潜变量则作为生成目标。

换句话说,图片既是条件的来源,也是完整生成目标:模型需要完成一个从局部视觉线索恢复完整图像的任务

  • 条件和目标来自同一块实际训练图像,两者天然对齐;
  • 随机遮挡确保模型需要根据上下文推断完整内容;
  • 恢复缺失内容的目标驱动 DiT 学习物体结构、上下文关系与视觉组成规律;
  • 冻结视觉编码器和理解骨干,只更新 Residual Query Adapter(RQA)、连接器和视觉生成器。





技术报告给出的 SFT 加权数据分布估计。训练内容覆盖自然、设计、人物与少量合成数据;图像预训练和中期训练只使用真实图像。

这条 “视觉优先” 的路线让真实图像的优势随着训练推进逐步显现。报告称,以真实图像为主的配方能够持续提升生成真实感,并展现出更高的长期能力上限。SFT 阶段因此一直让真实图像占绝对多数,同时在后期定向增加文字密集图像与人像数据。

从统计口径看,报告所说的 2.2 亿样本是图像生成管线各阶段的累计样本处理量;理解骨干的 CoT SFT 采用独立口径统计。

一个模型,怎样同时负责生成和编辑?

LLaDA-Image 的模型主体可以分为三部分:负责理解条件的 dLLM 视觉语言模型、连接理解与生成空间的轻量接口,以及真正生成图像的单流 DiT。



LLaDA-Image 架构。文本经 RQA、LLaDA2.0-mini 和 Connector 进入单流 DiT;编辑任务额外接收参考图像的语义特征和干净 VAE 潜变量。

先理解,再交给 DiT 生成

理解模块建立在 LLaDA2.0-mini 扩散语言模型之上。它不只是把提示词变成一组静态文本嵌入,而是作为统一的多模态语义接口,处理文本、训练时的视觉条件和结构化推理信息。

语言模型与图像生成器分别面向语义理解和视觉去噪,二者需要一套专门接口完成表示转换。为此,团队在中间加入了两层桥梁:

  • RQA在理解模型前放入一组可学习查询,通过交叉注意力从输入中提取与生成最相关的信息;
  • Transformer Connector再把理解模型的隐藏状态投影到 DiT 所需的条件空间。

视觉生成部分则是一套纯单流 DiT。文本条件 token、时间信息和图像 token 进入同一组 Transformer 模块,在每一层直接交互,最终预测 Flow Matching(流匹配)速度场。

编辑时,参考图像不经过语言模型

生成和编辑共享同一个理解接口与 DiT 主干,但参考图片走的是一条独立通道。

编辑指令仍由 RQA—dLLM—Connector 路径处理;参考图则完全绕过语言模型,同时提供两类互补信息:

  • SigLIP-VQ 特征提供高层语义信息,帮助模型识别参考图里 “是什么”;
  • 干净的 FLUX2-VAE 潜变量直接提供像素级证据,帮助保留原有身份、结构、纹理与背景。

这两类信号形成了互补:高层语义帮助模型理解编辑对象与指令,像素条件则强化身份、结构和纹理的一致性。两种参考信号一起进入同一个 DiT,使一套权重可以同时承担开放式生成与参考保持编辑。

编辑训练阶段,团队以 1:1 混合 T2I 与 I2I 数据。文生图样本在这里相当于 “能力回放”,持续巩固模型的开放生成、画质和文本对齐能力,让生成与编辑在共享主干上协同演进。

下面是报告中的四组编辑示例:



LLaDA-Image 指令图像编辑示例。

训练稳定性:为什么要拿掉 Norm 里的可学习参数?

对于一个需要长程训练的 6B 参数 DiT,稳定的网络 scaling 和 gradient norm 是整套工程得以持续扩展的基础。

团队在长程训练监控中发现,LayerNorm 或常规 RMSNorm 里的可学习参数会持续改变特征尺度;这种变化在深层网络和长训练周期中累积后,可能表现为 scaling 波动,并在后期带来gradient norm(梯度范数)快速上升

基于这一发现,LLaDA-Image 将归一化层设为无仿射参数形式,在整套 DiT 中统一使用无可学习参数的 RMSNorm。这个改动看起来很小,却直接针对长程训练中逐步累积的尺度漂移:它按照均方根对特征做归一化,并以固定形式维持尺度一致性。

优化器方面,团队在所有生成训练阶段都采用Muon,将其定位为训练系统中的工程选择;归一化层的无参数设计则直接负责改善 scaling 与后期 gradient norm 的稳定性。



临近收敛时,团队合并相邻训练状态的权重,以平滑不同 mini-batch 数据构成带来的指标波动。这些渐进训练、时间步采样和 checkpoint 处理共同组成了完整工程流程;其中,无可学习参数的 RMSNorm专门改善长程训练中的 scaling 与 gradient norm 稳定性。

从 50 步到 2—4 步:同一个 DiT 的 “正负两班制”

基础版 LLaDA-Image 追求完整的多步生成能力,技术报告把它列为 50 步采样。部署时,团队再用 TwinFlow 将它蒸馏为 LLaDA-Image-Turbo,把推理压缩到 2—4 步。

TwinFlow 建立在分布匹配蒸馏(DMD)之上。传统 DMD 训练通常同时需要:

  • 一个冻结的真实分布 score 模型;
  • 一个在线跟踪学生分布的 fake-score 模型;
  • 一个真正要部署的生成器。

传统 DMD 为生成器和在线 fake-score 估计器分别维护相应角色;TwinFlow 则进一步思考,能否用一套共享主干完成这两项工作。

TwinFlow 最巧妙的地方,可以概括成同一个 DiT 的 “正负两班制”:正时间负责生成,负时间负责跟踪学生分布。 具体来说, +t表示生成器更新,-t表示 fake-score 更新;两者共享主干、使用两个输出头,训练时以 1:2 的比例交替更新生成器与 fake-score 分支。

到了推理阶段,系统只保留生成头,fake-score 输出头完成训练使命后退出,部署开销与单生成头保持一致。

在 Qwen-Image-Bench 上,基础版的英文、中文总分分别为 53.53 和 53.38;4 步评测的 Turbo 则达到 50.98 和 50.27。同一模型家族由此形成两种互补部署档位:基础版侧重完整质量,Turbo 侧重推理速度。

九成样本不带文本,最终做到了什么?

技术报告用 Qwen-Image-Bench 作为主要综合生成基准。该基准包含 1,000 条分层提示词,考察画面质量、美学、提示词对齐、现实世界保真和创意生成,并分别提供英文与中文评测。

下面进一步选取报告中分数相近的部分开源与闭源模型进行比较:



Qwen-Image-Bench 部分模型结果,分数来自技术报告。各模型均采用标准推理设置和原始提示词进行比较。

最直观的参照是:把开源与闭源模型放进同一张榜单,LLaDA-Image 在中英文两条轨道上的总分,均位于 GPT Image 1 与 Imagen 4.0 Ultra 之间。

在报告列出的开源模型中,LLaDA-Image 的英文总分领先第二名 Z-Image-Turbo 1.87 分,中文领先 0.67 分;质量、美学和提示词对齐三个分项,在中英文开源模型中也均排名第一。

文字生成方面,LLaDA-Image 在 LongText-Bench 英文和中文部分分别达到0.923、0.913。在包含广告、海报、表情包和街景等多文字区域的 CVTG-2K 上,其平均单词准确率为、归一化编辑距离(NED)为 0.945、CLIPScore 为;在包含 2—5 个文字区域的不同难度设置下,单词准确率保持在 0.857—0.892。

指令编辑方面,LLaDA-Image 在 GEdit-Bench 英文、中文轨道上的总分分别为。这组结果展示了一套共享权重同时完成文生图与双语图像编辑的能力,也体现了统一模型路线的价值。

报告还给出了两个传统诊断基准:GenEval 总分为0.85,DPG-Bench 总分为。其中 GenEval 的单物体和双物体得分分别为 1.00 和 0.98,属性绑定为 0.84;计数能力目前为 0.53,也是后续可以继续提升的方向。

“全栈开源”,这次具体开放了什么?

榜单成绩提供了一个醒目的结果,完整开放的训练链条进一步扩展了这项工作的研究价值。LLaDA-Image 把从 “图片如何变成视觉先验” 到 “模型如何压缩到 2—4 步” 的路径连了起来。

具体来看,这次开放覆盖了五个关键环节:



这里的 6B 参数对应核心 DiT;完整系统还包括冻结的 LLaDA2.0-mini 理解骨干、视觉编码器、VAE、RQA 和 Connector。模块边界和各阶段配方一并给出,使研究者既可以观察完整系统如何协同,也可以按自身需求复用其中的纯图片预训练、统一编辑或少步蒸馏模块。

“开源 SOTA” 的口径同样清晰:它指 LLaDA-Image 在技术报告所列模型及标准评测设置下,取得 Qwen-Image-Bench 英文、中文开源模型第一。与此同时,同一套权重还覆盖双语长文本渲染与指令图像编辑,形成了从综合生成、文字能力到编辑能力的完整验证。

报告也给出了下一步方向:继续扩展世界知识、提高长文本与多区域排版的稳定性,并推进原生 2K 生成。对于社区而言,这套开放框架也为后续探索留下了清晰接口。

SGLang Day-0 支持 LLaDA-Image 推理

在 LLaDA-Image 开源之际,InclusionAI 与 SGLang 社区协作完成了 Day-0 推理适配。针对模型的多组件推理链路,双方完成了少步采样、序列并行和 FP8 推理等适配。基于 SGLang Diffusion,用户可通过同一套推理框架部署 Base、Turbo 及相应的 FP8 版本,支持文生图和图像编辑,并可通过兼容 OpenAI Images API 的接口提供服务。

结语

LLaDA-Image 的核心路线可以压缩成八个字:先学会画,再学会听话。 纯图片承担大规模视觉先验学习,图文对集中完成语言对齐;生成、编辑与快速部署,则继续接到同一套系统中。

模型权重、训练代码与详细配方的同步开放,让这个 6B DiT 从图片出发、走过语言对齐与统一编辑、最终落到 2—4 步部署的全过程,都成为可以研究和继续推进的技术路径。

当图文对不再是预训练的入场券,纯图片也就从 “等待配上文字的数据”,变成了视觉生成预训练的主角。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
9月6日,工商银行存款利率调整?存入20万元,三年后有多少利息?

9月6日,工商银行存款利率调整?存入20万元,三年后有多少利息?

白昼说故事
2026-09-07 10:33:18
严肃警告:不要买!不要吃!里面含有硼砂,危害健康,别害了自己

严肃警告:不要买!不要吃!里面含有硼砂,危害健康,别害了自己

健身狂人
2026-09-06 13:46:44
2026年,中国小学一年级新生人数迎来了一个历史性的转折点。

2026年,中国小学一年级新生人数迎来了一个历史性的转折点。

一口娱乐
2026-09-07 07:59:43
“大量蛇精,蜈蚣精来了!”浙江真人版“葫芦爷爷”事件,走向了最魔幻的一幕……

“大量蛇精,蜈蚣精来了!”浙江真人版“葫芦爷爷”事件,走向了最魔幻的一幕……

桌子的生活观
2026-09-07 12:34:38
法院逮捕令前脚落地,老杜女儿后脚就主动投案,这一招意味深长

法院逮捕令前脚落地,老杜女儿后脚就主动投案,这一招意味深长

墨兰史书
2026-09-08 01:55:03
女篮首节吊打意大利!杨舒予+2内齐爆,罗欣棫统治攻守!

女篮首节吊打意大利!杨舒予+2内齐爆,罗欣棫统治攻守!

篮球资讯达人
2026-09-08 03:06:29
法国大选杀出大黑马,昔日中国老朋友归来,中法关系迎来两种可能

法国大选杀出大黑马,昔日中国老朋友归来,中法关系迎来两种可能

慕名而来只为你
2026-09-07 22:33:26
曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

可达鸭面面观
2026-09-06 15:14:05
网民“峰哥”大肆招揽外籍人员来华搞“转运做法”,天津边检出手

网民“峰哥”大肆招揽外籍人员来华搞“转运做法”,天津边检出手

观察者网
2026-09-06 20:05:49
中国的萝卜快跑明明已经跑了4年,可为什么生意越来越少了?

中国的萝卜快跑明明已经跑了4年,可为什么生意越来越少了?

流苏晚晴
2026-09-07 11:52:58
伊朗博主当场开怼全网:中国人根本没意识到自己的体量有多吓人!一个省就顶得上一个国家,14亿人口的规模让全世界都看呆了

伊朗博主当场开怼全网:中国人根本没意识到自己的体量有多吓人!一个省就顶得上一个国家,14亿人口的规模让全世界都看呆了

z千年历史老号
2026-09-07 18:16:52
终于有人敢说真话了!金灿荣教授 9 月 5 日重磅发声

终于有人敢说真话了!金灿荣教授 9 月 5 日重磅发声

流逝的颜值
2026-09-07 10:08:42
似曾相识,RMC:姆巴佩发布会两次移开汽水瓶

似曾相识,RMC:姆巴佩发布会两次移开汽水瓶

懂球帝
2026-09-07 20:49:20
星宇股份通报称最大笑话:老板自罚1年工资,背锅侠人事总监被爆61岁已退休

星宇股份通报称最大笑话:老板自罚1年工资,背锅侠人事总监被爆61岁已退休

Mr王的饭后茶
2026-09-07 22:01:39
成龙确诊ADHD,粉丝心疼极了

成龙确诊ADHD,粉丝心疼极了

大爱三湘
2026-09-05 22:24:19
全场看呆!美军连夜狂射130枚导弹,中国预警机全程在线围观

全场看呆!美军连夜狂射130枚导弹,中国预警机全程在线围观

共工之锚
2026-09-05 00:20:38
我领馆提醒:所有计划前往的中国游客,取消行程!

我领馆提醒:所有计划前往的中国游客,取消行程!

第一财经资讯
2026-09-06 17:17:43
中美俄朝韩集体出手,5国联合打日,离终极分日还差最后一把火候

中美俄朝韩集体出手,5国联合打日,离终极分日还差最后一把火候

战友老邓
2026-09-07 10:58:35
妙招!王俊杰签约香港金牛绕开CBA选秀,保留NBA梦想+收入暴涨

妙招!王俊杰签约香港金牛绕开CBA选秀,保留NBA梦想+收入暴涨

林小湜体育频道
2026-09-08 00:31:00
“车灯女王”周晓萍,被扣薪12个月

“车灯女王”周晓萍,被扣薪12个月

中国新闻周刊
2026-09-07 13:05:13
2026-09-08 04:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13940文章数 142729关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

家居
游戏
亲子
艺术
时尚

家居要闻

2026建博会(广州) 公装联探展交流活动

鸣潮费大劲捏出来的清冷师尊,咋就变成了哦齁剑仙?

亲子要闻

小女孩第一次学做蛋糕,就被妈妈无情的嘲讽影视解说

艺术要闻

太罕见!苏轼这幅字流落民间900年,险些被当废纸卖掉……

内娱女星,纷纷“去父留子”

无障碍浏览 进入关怀版