网易首页 > 网易号 > 正文 申请入驻

港科联合快手可灵提出高效强化学习后训练扩散模型新范式

0
分享至

在使用强化学习(RL)微调扩散模型(如 Stable Diffusion, Flux)以对齐人类偏好时,我们常面临一个棘手的 “两难困境”:追求高奖励会导致图像质量崩坏(即 Reward Hacking),而为了防止崩坏引入的 KL 正则化又会严重阻碍模型的探索和收敛。

最近,来自于香港科技大学,快手可灵 AI,港中文以及爱丁堡大学的研究团队提出了一种全新的框架 GARDO。它通过门控自适应正则化和多样性感知优化,成功在防止 Reward Hacking 的同时,实现了高效的样本探索和多样性生成。研究工作已经全面开源。

论文第一作者何浩然是香港科技大学博士生,研究方向包括强化学习和多模态基础模型等,研究目标是开发下一代可扩展强化学习后训练算法。通讯作者为香港科技大学电子及计算机工程系、计算机科学与工程系助理教授潘玲。

  • 论文标题:GARDO: Reinforcing Diffusion Models without Reward Hacking
  • 项目主页:https://tinnerhrhe.github.io/gardo_project
  • 论文链接:https://arxiv.org/pdf/2512.24138

背景与动机:RL 后训练中的陷阱

强化学习(RL)在视觉领域的后训练中展现出了不错的效果,逐渐成为当前研究的热点。最近半年,如 flow-grpo,dancegrpo 以及 DiffusionNFT 等工作受到了大家广泛关注。

然而,在视觉任务中,定义一个完美的 “奖励函数(Reward Function)” 极其困难。我们通常使用的是一个代理奖励(Proxy Reward),例如 ImageReward、Aesthetic Score 或者 OCR 识别率。

这就导致了一个典型的问题:Reward Hacking。当模型过度优化这个代理奖励时,它会找到奖励模型的漏洞(Out-of-Distribution, OOD 区域)。结果就是,代理分数(Proxy Score)极高,但生成的图像充满了噪点、伪影,甚至完全失去了真实感。

Reward Hacking 定义

下面展示文生图出现 hacking 的例子:

为了解决这个问题,传统方法(如 DPOK, Flow-GRPO)通常引入 KL 散度正则化,强迫微调后的策略 π_θ 不要偏离原始参考策略 π_ref 太远。但研究团队发现,这种 “一刀切” 的 KL 正则化带来了新的问题:

  1. 样本效率低:RL 目标函数会被 KL 惩罚项的 π_ref 拖后腿,学习速度变慢。
  2. 阻碍探索:π_ref 本身通常是次优的,强制 π_θ 贴近它会阻止模型探索那些参考模型 π_ref 未发现的高奖励区域。

核心问题来了,能否在不牺牲样本效率和探索能力的前提下,防止 Reward Hacking?

GARDO:门控、自适应与多样性

为了打破上述困境,作者提出了GARDO (Gated and Adaptive Regularization with Diversity-aware Optimization) 框架

GARDO 方法概览图

KL-regularized RL 的最优解可以写成:

基于上述观察,GARDO 的框架基于三个核心洞察:

洞察一:正则化不需要 “雨露均沾”

方法:门控 KL 机制 (Gated KL Mechanism)

根据定义 1,只有当模型 π_θ 生成的样本落在代理奖励不可靠的区域(即 OOD 区域)时,才真正需要 KL 正则化。对于那些既高质量又在分布内的样本,施加惩罚只会阻碍学习。

GARDO 引入了不确定性估计(通过奖励模型集成 ranking 差异来衡量)。

  • 做法:只对那些具有高不确定性 (Reward Model 拿不准,可能是 Hacking)的样本施加 KL 惩罚。
  • 效果:实验发现,仅对约 10% 的高不确定性样本进行惩罚,就足以有效防止 Reward Hacking,让其余 90% 的样本自由探索。从而实现在不牺牲样本效率的情况下,有效抑制 hacking 现象的出现。

洞察二:静态的 π_ref 会限制 RL 优化的上限

方法:自适应正则化目标 (Adaptive Regularization Target)

如果 π_ref 一直不变,随着 π_θ 的变强,KL 惩罚会主导整个 learning Loss,导致优化停滞。

  • 做法:定期更新 Reference Model π_ref(将其重置为当前的策略)。
  • 效果:这就像给模型设立了动态更新的 “锚点”,既保证了训练的稳定性,又允许模型持续进化,探索更广阔的空间。

洞察三:RL 容易 mode collapse,需要鼓励多样性生成

方法:多样性感知优势重塑 (Diversity-Aware Advantage Shaping)

RL 训练容易导致 Mode Collapse(模式坍塌),即模型发现一种高分画法后就只会画这一种。这不仅降低了生成质量,也加剧了 Reward Hacking。

  • 做法:利用 DINOv3 提取特征,计算样本在特征空间中的稀疏度作为 “多样性分数”。将此分数以乘法形式作用于优势函数(Advantage)。

  • 注意:只奖励那些既有正向优势(高质量)又具有高多样性的样本,防止模型为了多样性而生成乱七八糟的东西。

研究团队在高斯混合分布(预训练分布)上训练了一个包含三层 MLP 的扩散模型,目标是捕捉奖励景观中所示的多模态高奖励聚类。使用较大 KL 系数 β 的传统强化学习方法约束过强,无法提升奖励。与之相对,过小的 β 则会导致严重的模式坍缩。团队提出的多样性感知优化方法单独使用时,已成功捕捉到多模态聚类,包括参考策略 π_ref 中概率密度最低的中心聚类。而团队提出的完整的 GARDO 框架则能同时实现奖励最大化并发现所有高奖励聚类。

实验结果:全方位的提升

作者在 SD3.5-Medium 和 Flux.1-dev 等多个基底模型上,针对不同的奖励任务(GenEval, OCR, Aesthetic 等)和不同的 RL 算法(flow-grpo,DiffusioNFT 等)进行了广泛实验。

定量评估

相比于 Flow-GRPO 等基线方法,GARDO 展现了显著的优势:

  1. 拒绝 Hacking:在 OCR 等易被 Hack 的任务中,GARDO 在保持高识别率的同时,图像质量指标(如 Aesthetic, PickScore)没有下降,甚至有所提升。
  2. 样本效率:学习曲线显示,GARDO 能够以更少的步数达到更高的奖励水平。
  3. 泛化性:在未见过的测试指标上(Unseen Metrics),GARDO 表现出极强的鲁棒性。

GARDO 和 baseline 在不同 metric 上的表现。训练优化代理任务黄色高亮。

涌现能力

最令人印象深刻的是 GARDO 激发了模型的涌现能力(Emergent Behavior)。

在极具挑战性的 “数数任务”(生成特定数量的物体)中,基底模型和传统 RL 方法很难生成超过 9 个物体。

而 GARDO 成功学会了生成 10 个甚至 11 个物体。

总结

GARDO 针对扩散模型 RL 后训练中的痛点,提出以下解决方案:

  • 拒绝盲目正则化 →→ 门控 KL(只惩罚不可靠的)
  • 拒绝静态锚点 →→ 自适应更新(不断提升上限)
  • 拒绝模式坍塌 →→ 多样性感知(鼓励百花齐放)

这项工作证明了:在视觉生成的强化学习中,精准的控制比强力的约束更重要。对于希望利用 RL 进一步释放扩散模型潜力的研究者和开发者来说,GARDO 提供了一个极具价值的通用框架。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
衣不蔽体、医美成性,41岁戚薇会走到如今的境地,根本怪不了别人

衣不蔽体、医美成性,41岁戚薇会走到如今的境地,根本怪不了别人

眉眼动人
2026-09-28 18:46:08
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
《兰香如故》大结局:直到圆房后,许兰香才明白,林锦岐一直守身如玉

《兰香如故》大结局:直到圆房后,许兰香才明白,林锦岐一直守身如玉

天玑影视说
2026-09-29 21:39:47
终于破案了!蚊子专挑你咬并非因为血型!真正原因很多人都搞错了

终于破案了!蚊子专挑你咬并非因为血型!真正原因很多人都搞错了

白浅娱乐聊
2026-09-26 00:42:53
隔夜肉隔夜水都能吃,唯独它隔夜比砒霜毒,再心疼也得倒!

隔夜肉隔夜水都能吃,唯独它隔夜比砒霜毒,再心疼也得倒!

马蹄烫嘴说美食
2026-09-29 10:29:09
李小璐和贾乃亮的新瓜,让人意想不到

李小璐和贾乃亮的新瓜,让人意想不到

In风尚
2026-09-30 06:03:10
马筱梅晒7个月儿子正面照,长相神似奶奶张兰,她坦言不愿意生二胎了

马筱梅晒7个月儿子正面照,长相神似奶奶张兰,她坦言不愿意生二胎了

追影客栈
2026-09-29 12:30:44
前主持人赵普透露,刘欢食量和酒量惊人,一顿吃10只闸蟹,独饮3瓶红酒面不改色

前主持人赵普透露,刘欢食量和酒量惊人,一顿吃10只闸蟹,独饮3瓶红酒面不改色

小椰的奶奶
2026-09-28 16:53:10
奚梦瑶夫妇答谢宴,四太红唇好土,甘比谢玲玲到了,何超琼站C位

奚梦瑶夫妇答谢宴,四太红唇好土,甘比谢玲玲到了,何超琼站C位

月光作笺a
2026-09-29 11:15:33
风向又变?中国最大支柱产业曝光,或取代房地产,将来或超越美国

风向又变?中国最大支柱产业曝光,或取代房地产,将来或超越美国

原来仙女不讲理
2026-09-29 21:08:50
日媒称白宫沉默令人不安! 中国在联合国展开攻势: 日本已进退失据

日媒称白宫沉默令人不安! 中国在联合国展开攻势: 日本已进退失据

趣文说娱
2026-09-30 03:05:31
荷兰制裁以色列——道德外衣之下的肮脏

荷兰制裁以色列——道德外衣之下的肮脏

老王说正义
2026-09-29 10:21:03
美联储降息都难以挽救中国楼市?高盛预测:房价真底部在2027年?

美联储降息都难以挽救中国楼市?高盛预测:房价真底部在2027年?

爱看剧的阿峰
2026-09-30 07:40:28
陪睡门主角魏莹奢靡生活曝光,豪车出行、到处旅游打卡,纸醉金迷

陪睡门主角魏莹奢靡生活曝光,豪车出行、到处旅游打卡,纸醉金迷

一曲一场談
2026-08-20 15:50:26
杭州KTV风暴余波:姑娘们抱着爱马仕排队套现,相亲圈一夜变天

杭州KTV风暴余波:姑娘们抱着爱马仕排队套现,相亲圈一夜变天

社会日日鲜
2026-09-29 06:38:15
随着瑞士3-0、英格兰2-0、西班牙4-1,欧国联最新积分榜出炉

随着瑞士3-0、英格兰2-0、西班牙4-1,欧国联最新积分榜出炉

侧身凌空斩
2026-09-30 04:49:39
底层的戾气越来越严重了,有网友说底层的戾气来源于分配不均!

底层的戾气越来越严重了,有网友说底层的戾气来源于分配不均!

黯泉
2026-09-29 18:37:09
第33届金鹰奖,于和伟、宋佳再封帝后,梅婷拿奖感谢了杨紫,朱亚文获奖宋佳哭了

第33届金鹰奖,于和伟、宋佳再封帝后,梅婷拿奖感谢了杨紫,朱亚文获奖宋佳哭了

娱君坠星河
2026-09-29 22:41:53
赌王三太庆祝71岁生日,齐娇带2个孩子为奶奶祝寿

赌王三太庆祝71岁生日,齐娇带2个孩子为奶奶祝寿

素素娱乐
2025-03-03 08:39:28
中秋晚会主持翻车!全程不看镜头:观众一眼出戏 是提词器装错了?

中秋晚会主持翻车!全程不看镜头:观众一眼出戏 是提词器装错了?

阿废冷眼观察所
2026-09-28 03:53:04
2026-09-30 10:12:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14105文章数 142740关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

牛弹琴:全部美军灰溜溜走了 伊拉克举国兴奋放假4天

头条要闻

牛弹琴:全部美军灰溜溜走了 伊拉克举国兴奋放假4天

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

本地
时尚
手机
公开课
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

老板,我的脑子好像忘在家里了

手机要闻

涉及约5000人:古尔曼称苹果已搁置AI替代AppleCare客服计划

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗最高领袖最新发声:伊朗现已变得独立、强大

无障碍浏览 进入关怀版