多对多语义与先验。语义先验用于判断在线 Reward 的偏离是否可信
RAS + CRT: 一层决定组级权重,一层重塑组内区分。
图生视频结果:输入主体保持与动作表现的对比。
当奖励模型也会误判,视频生成后训练该信什么
视觉生成模型用强化学习追逐 Reward 时,评分器并不是永远正确的裁判。
一个文本提示可以对应多种合理视频,Reward Model 却必须给出单一分数。策略模型持续更新后,生成分布还会逐渐离开评分器熟悉的范围。高分可能来自真实改进,也可能只是碰到了评分盲区。
BPGO 试图让 GRPO 在更新前多问一句:这次反馈值得信吗?
分数精确,不代表语义确定
文本与视觉的多对多对应,让 Reward 更接近带误差的测量,而不是固定标签。同组视频只差几个小数点,未必真的存在稳定排序。
标准 GRPO 会把这些差值用于相对优势。一旦噪声被放大,模型可能过拟合偶然高分;真正好的探索也可能因分数不够显著而被忽略。
![]()
两层信任分配
BPGO 引入 semantic prior anchor,再用两个模块处理不确定性。
RAS 面向不同 rollout 组。某组 Reward 与先验关系稳定,就允许它对训练产生更大影响;异常组则被降权。
CRT 面向同一组内部。可信差异得到增强,可能来自噪声的微小波动被压缩。
![]()
两者的组合让算法不再把所有 Reward 同等对待。它既保持探索,也减少被不可靠反馈拖走的机会。
从视频扩展到图像
研究覆盖文本生成视频、图像生成视频和文本生成图像。跨任务结果显示,BPGO 改善语义对齐和感知质量,训练曲线也更稳定。
![]()
这一点说明,方法处理的并非某个视频架构特有的故障,而是视觉 Reward 进入相对优化时的共同问题。
评分器之外
提高 Reward Model 能力仍然重要,但无法消除多解语义和在线分布漂移。BPGO 把研究焦点从“怎样获得更高分”移到“分数是否可用”。
风险同样存在。先验如果落后于策略,算法可能误伤真正创新的样本;不同评分器也需要不同校准。信任机制不能替代评价能力,只能约束评价怎样进入更新。
在线 Reward 为什么比离线误判更危险
评分器离线判错一条样本,损失通常停在那次排名。进入强化学习回路后,误判会改变策略,策略再生成更多接近误判区域的内容。一次偏差因此可能演变成新的数据分布。
视觉生成又很难依靠唯一答案纠错。同一句文字可以对应远景、近景和多种动作速度,Reward 给出 0.82 或 0.79,看似精确,却未必代表稳定的语义差距。组内归一化若把这点差异继续放大,训练会认真追逐一次测量噪声。
BPGO 的行业价值就在这条反馈链上。它不要求所有不确定性在评分器内部被解决,而是在优化阶段继续判断观测的可信程度。对于需要频繁更新 Reward、生成成本又很高的视频系统,这种“先判断是否值得押注”的机制能减少无效 rollout 被反复放大。
稳定之外,还要防止模型不敢探索
可靠性控制天然有保守倾向。先验来自已有分布,真正新颖的语义组合往往正是最先偏离先验的样本。若系统只奖励熟悉结果,曲线会很稳,模型却可能失去发现新能力的空间。
判断 BPGO 是否健康,不能只看 Reward 上升速度。被 RAS 降权的样本后来是否被人类认为更差,CRT 拉开的组内差异能否在其他评测器上复现,生成多样性是否下降,都需要同时观察。
论文覆盖文本生成视频、图像生成视频和文本生成图像,说明机制不依赖某一种时间建模结构。但跨领域使用仍要重新选择先验,并检查不同 Reward 的尺度。审美分、文本对齐分和运动分的误差形态并不相同,同一个信任参数未必通用。
BPGO 把 Reward 从“判决”重新放回“观测”的位置。观测可以很有用,也可能在陌生区域失准。后训练系统真正成熟的标志,不是再也不怀疑评分器,而是知道什么时候该信、什么时候应该把问题交回人评与数据。
信任机制还需要留下审计记录。哪些 rollout 被降权、当时使用哪一版先验、后来的人评结果如何,都应能够回溯。
如果 anchor 更新后历史权重被覆盖,团队很难判断曲线变稳来自模型进步,还是参照尺度发生变化。对长期在线训练来说,先验版本管理与算法本身同样重要。
对在线系统而言,异常组也不应被永久丢弃。它们可能是 Reward 失准,也可能代表策略到达新区域,抽样回看才能区分。
这份回看记录也能反过来训练下一版 Reward Model。
视觉生成后训练正在从盲目追分,走向对反馈来源和可信度的共同建模。一个分数是否高,只是问题的一半。
论文原文与引用
本文解读的论文原题为 *Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation*。
- 发表信息:CVPR 2026;arXiv:2511.18919v1
Ruiying Liu, Yuanzhi Liang, Haibin Huang, Tianshu Yu, and Chi Zhang. “Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation.” Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026.
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.