网易首页 > 网易号 > 正文 申请入驻

清华与NVIDIA合作推出DiffusionNFT,训练效率提升25倍!

0
分享至

来源:市场资讯

(来源:机器之心Pro)

清华大学朱军教授团队, NVIDIA Deep Imagination 研究组与斯坦福 Stefano Ermon 团队联合提出了一种全新的扩散模型强化学习(RL)范式 ——Diffusion Negative-aware FineTuning (DiffusionNFT)。该方法首次突破现有 RL 对扩散模型的基本假设,直接在前向加噪过程(forward process)上进行优化,在彻底摆脱似然估计与特定采样器依赖的同时,显著提升了训练效率与生成质量。文章共同一作郑凯文和陈华玉为清华大学计算机系博士生。


背景 | 扩散模型的 RL 困境

近年来,强化学习在大语言模型(LLMs)后训练中的巨大成功,催生了人们将类似方法迁移到扩散模型的探索。例如,FlowGRPO 等方法通过将扩散采样过程离散化为多步决策问题,从而在反向过程上应用策略梯度优化。然而,这一思路存在多重根本性局限:

1.似然估计困难:自回归模型的似然可精确计算,而扩散模型的似然只能以高开销近似,导致 RL 优化过程存在系统性偏差。

2.前向–反向不一致:现有方法仅在反向去噪过程中施加优化,没有对扩散模型原生的前向加噪过程的一致性进行约束,模型在训练后可能退化为与前向不一致的级联高斯。

3.采样器受限:需要依赖特定的一阶 SDE 采样器,无法充分发挥 ODE 或高阶求解器在效率与质量上的优势。

4.CFG 依赖与复杂性:现有 RL 方案在集成无分类器引导 (CFG) 时需要在训练中对双模型进行优化,效率低下。

因此,如何设计一种既能保留扩散模型原生训练框架,又能高效融入强化学习信号的统一方法,是亟待探索的问题。

方法 | 基于前向过程的负例感知微调


DiffusionNFT 提出了一个全新的思路:把强化学习直接作用于扩散的前向加噪过程,而非反向去噪轨迹。这一设计带来了范式性的转变。

核心机制包括:

正负对比的改进方向:在采样生成中,利用奖励信号将样本划分为正例与负例,从而定义出一个隐式的 “改进方向”。与只使用正样本的拒绝采样微调(Rejection FineTuning, RFT)不同,DiffusionNFT 显式利用负样本信号,确保模型有效 “避开” 低质量区域。


负例感知微调 (Negative-aware FineTuning, NFT):通过一种巧妙的隐式参数化方式,从目标模型同时定义正向策略与负向策略,将正负分布对比转化为单一网络的训练目标,不需额外判别器或引导模型。


强化指导 (Reinforcement Guidance):在数学上,DiffusionNFT 将优化目标刻画为对旧策略分布的偏移量 ∆,这一过程与 CFG 类似,但不依赖双模型结构,而是内生于训练目标中。

这样的设计使 DiffusionNFT 同时满足以下优势:

1.前向一致性:训练目标严格符合扩散的 Fokker–Planck 方程,不破坏与前向过程的一致性,使得训练后的模型仍然是良定义的扩散模型。

2.采样器自由:训练与采样彻底解耦,可使用任意黑盒 ODE/SDE 求解器,摆脱对一阶 SDE 的依赖;同时在训练时只需存储最终样本与对应奖励值,无需整条采样轨迹。

3.似然无关:不再需要变分下界或反向轨迹似然估计,训练只依赖生成图像与奖励。

4.CFG-free 原生优化:直接学习到奖励引导的生成能力,避免 CFG 的推理开销,同时仍可兼容 CFG 进一步提升性能。

实验 | 高效性与生成质量

研究团队在多个奖励模型上验证了 DiffusionNFT 的有效性。主要结果包括:

大幅效率提升:在 GenEval 任务上,DiffusionNFT 仅需1k步 即可将得分从0.24 → 0.98,而 FlowGRPO 需超过5k步才能达到 0.95。整体上,DiffusionNFT 在不同任务上表现出3×~25× 的训练效率优势。


CFG-free 场景下显著提升:即便完全不依赖 CFG,DiffusionNFT 也能在美感、对齐度等方面显著优于原始模型。

多奖励联合优化:在 SD3.5-Medium 上同时优化 GenEval、OCR、PickScore、ClipScore、HPSv2.1 等多种奖励,最终模型在所有指标上均超越原始模型,与只针对单一奖励进行优化的 FlowGRPO 持平,并超过更大规模的 SD3.5-L 与 FLUX.1-Dev 模型。


展望 | 向统一的生成对齐范式迈进

DiffusionNFT 的提出,不仅为扩散模型的强化学习提供了一个高效、简洁且理论完备的新框架,也对更广泛的生成模型对齐研究具有启发意义。从语言模型到视觉生成,DiffusionNFT 展示了负例感知 + 前向一致性普适价值。它打破了似然估计与反向轨迹的限制,建立起监督学习与强化学习之间的桥梁。在未来,DiffusionNFT 有望推广至多模态生成、视频生成以及大模型对齐等更复杂场景,成为统一的生成优化范式。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
今年中甲好看了!延边龙鼎签下邦本宜裕:新赛季4队冲超

今年中甲好看了!延边龙鼎签下邦本宜裕:新赛季4队冲超

邱泽云
2026-01-09 17:14:33
2026港片神仙打架!刘德华谢霆锋13年后再对决,《九龙城寨》期待

2026港片神仙打架!刘德华谢霆锋13年后再对决,《九龙城寨》期待

小椰的奶奶
2026-01-05 00:33:07
北京发沙尘蓝色预警!夜间局地阵风超10级

北京发沙尘蓝色预警!夜间局地阵风超10级

大峰
2026-01-09 16:28:21
女人染上“性瘾”是一种怎样的体验?可能和你想象得不同

女人染上“性瘾”是一种怎样的体验?可能和你想象得不同

纸上的心语
2025-11-23 11:36:00
别墅搜出23件国宝,全家集体失联!徐湖平案落幕,17年举报有结果

别墅搜出23件国宝,全家集体失联!徐湖平案落幕,17年举报有结果

诗意世界
2026-01-03 15:19:25
亲手把孩子逼到厌学才猛然醒悟:真正压垮孩子的,不是学习成绩,也不是竞争压力,而是父母的“过度期待”

亲手把孩子逼到厌学才猛然醒悟:真正压垮孩子的,不是学习成绩,也不是竞争压力,而是父母的“过度期待”

青春期父母成长学堂
2026-01-08 20:49:11
脚是心梗的放大镜?忠告:脚部出现这几种表现,要尽快就医!

脚是心梗的放大镜?忠告:脚部出现这几种表现,要尽快就医!

岐黄传人孙大夫
2025-12-25 09:56:07
郑丽文给足排场!赖清德或顾及影响放过蔡正元?想翻盘得看国民党

郑丽文给足排场!赖清德或顾及影响放过蔡正元?想翻盘得看国民党

乐天闲聊
2026-01-08 13:47:52
事发上海地铁!男子弄丢5万元婚戒,找到时戴在别人手上摘不下来……

事发上海地铁!男子弄丢5万元婚戒,找到时戴在别人手上摘不下来……

环球网资讯
2026-01-09 14:39:17
委内瑞拉的石油真的“质量差”吗?

委内瑞拉的石油真的“质量差”吗?

返朴
2026-01-08 10:14:19
战北京邱彪停赛,高诗岩:对我们影响挺大,每个人都不可或缺

战北京邱彪停赛,高诗岩:对我们影响挺大,每个人都不可或缺

懂球帝
2026-01-09 12:12:13
北京亿万富豪连捅妻子13刀后自杀,留下遗书:最毒不过妇人心

北京亿万富豪连捅妻子13刀后自杀,留下遗书:最毒不过妇人心

灿烂夏天
2024-10-21 22:58:02
分手传闻持续发酵后,一言不发的庞众望,终于不再顾忌所谓的体面

分手传闻持续发酵后,一言不发的庞众望,终于不再顾忌所谓的体面

观察者海风
2026-01-08 09:35:23
蒋孝严带着儿子蒋万安去给他的奶奶上坟,蒋万安手里还拿着黄纸

蒋孝严带着儿子蒋万安去给他的奶奶上坟,蒋万安手里还拿着黄纸

大江
2026-01-08 14:50:15
哇塞!北京队将有重磅签约!这可是NBA总冠军中锋

哇塞!北京队将有重磅签约!这可是NBA总冠军中锋

篮球实战宝典
2026-01-09 06:59:35
善恶终有报,57岁央视女主持王小丫,原来早已经走上另一条大路

善恶终有报,57岁央视女主持王小丫,原来早已经走上另一条大路

梦录的西方史话
2025-10-29 15:48:51
未来三年,四川省内户籍身份证有效期满换证数量将达2500万余张

未来三年,四川省内户籍身份证有效期满换证数量将达2500万余张

封面新闻
2026-01-09 12:57:23
放弃争夺数百亿遗产,带着女儿远遁美国,如今才知道她有多清醒

放弃争夺数百亿遗产,带着女儿远遁美国,如今才知道她有多清醒

梦史
2025-12-16 11:07:49
迈克-布朗:泰伦-卢今年赚了1400万,28年前欠我的100啥时候还

迈克-布朗:泰伦-卢今年赚了1400万,28年前欠我的100啥时候还

懂球帝
2026-01-09 09:43:23
40岁Coco曝谢贤4斤青菜只炒一盘菜心吃,谢霆锋爱做饭受父亲影响

40岁Coco曝谢贤4斤青菜只炒一盘菜心吃,谢霆锋爱做饭受父亲影响

好贤观史记
2026-01-09 18:01:17
2026-01-09 21:47:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
1977781文章数 5200关注度
往期回顾 全部

科技要闻

市场偏爱MiniMax:开盘涨42%,市值超700亿

头条要闻

女子"出轨"已婚985高校博士后 看到其聊天记录吓傻了

头条要闻

女子"出轨"已婚985高校博士后 看到其聊天记录吓傻了

体育要闻

金元时代最后的外援,来中国8年了

娱乐要闻

关晓彤鹿晗风波后露面 不受影响状态佳

财经要闻

投资必看!瑞银李萌给出3大核心配置建议

汽车要闻

助跑三年的奇瑞 接下来是加速还是起跳?

态度原创

本地
家居
房产
公开课
军事航空

本地新闻

云游内蒙|“包”你再来?一座在硬核里酿出诗意的城

家居要闻

木色留白 演绎现代自由

房产要闻

66万方!4755套!三亚巨量房源正疯狂砸出!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普:已开始从委石油资源中赚钱

无障碍浏览 进入关怀版