GRPO 统一更新整条样本,ViPO 在样本内部重新分配强度。
PSM 结构:视觉偏好提取与分配图生成流程。
视频时序结果:车辆和人物动作中的跨帧比较。
视觉生成模型进入强化学习阶段后,一个老问题越来越明显:Reward 可以判断整张图好不好,却很难告诉模型究竟哪里出了错。
脸部、手指、文字和运动结构的错误往往集中在局部。标准 GRPO 通常给每个样本一个标量优势,更新压力铺向完整图像或视频。结果可能是,为修两根手指,连正确背景也被改动;某几帧动作崩坏,又被整体画面质量掩盖。
ViPO 给出的方案,是把“总分”重新展开。
标量反馈遇上结构化内容
ViPO 全称 Visual Preference Policy Optimization。它保留 GRPO 的样本组比较,再增加 PSM,将标量 advantage 转为空间和时间敏感的优势图。
![]()
PSM 使用预训练视觉 backbone 提取感知结构,不需要新的像素级人工标注。它生成的 allocation map 说明主体、关键局部和运动位置的重要程度。
这张图不负责决定哪个样本更好。GRPO 已经给出方向,PSM 只负责安排梯度主要落在哪里。ViPO 因而把分配图作用在 advantage 层,避免直接改写 Reward 排序。
![]()
图像和视频都得到验证
在 FLUX.1-dev 图像后训练中,ViPO 的 HPSv2.1 达到 0.3321,高于原始模型和 DanceGRPO。PickScore、ImageReward 等域外指标也保持改善,没有只针对一个评分器优化。
视频测试使用 Wan2.1-T2V-14B-480P。视觉质量、运动质量与 VBench 综合指标均有提升。定性样例中,重点差异出现在动作区域、主体形态和跨帧一致性,而不是简单增加锐度或颜色饱和度。
![]()
研究还设置了只鼓励“更红”的极端 Reward。标量方法更容易把整幅内容推向红色,并损伤角色身份;ViPO 的局部分配减弱了这种全局扩散。
奖励模型之外的新接口
视觉生成后训练过去常把精力集中在 Reward Model:评分器是否更大、数据是否更多、对齐是否更准。ViPO 指向另一层瓶颈。即便 Reward 已捕捉到局部质量,压成标量再送进优化器,细节仍可能在接口处丢失。
这不意味着 PSM 永远能找对区域。它依赖预训练视觉表征,也没有纠正错误价值目标的能力。视频动作还涉及对象轨迹和长期依赖,帧级热图只是起点。
一条新的后训练分工
过去改进视觉生成强化学习,注意力常集中在“怎样得到更好的分数”。ViPO 把视线移到分数之后:即使 Reward 暂时不变,更新信号怎样进入有空间和时间结构的内容,也会决定模型学到什么。
这意味着视觉后训练可能出现更清楚的模块分工。Reward Model 负责总体偏好,组内优化负责相对方向,PSM 一类模块负责空间时序 credit assignment。不同环节可以分别审计,而不必把评分、定位和梯度全部塞进一个黑箱。
域外结果在这里比单项涨分更关键。若模型只在被优化的 HPSv2.1 上提高,却在 PickScore、ImageReward 或 VBench 上退化,结构化分配可能仍在放大局部偏好。论文同时观察域内与 OOD 指标,就是为了避免把“更会讨好一位裁判”写成整体能力提升。
从热图走向真实梯度还有门槛
PSM 依赖预训练视觉 backbone。它能看到主体,不代表一定能看到文本拼写、细微手指结构或一段动作背后的因果关系。不同 backbone 对语义、纹理和边界的敏感程度也不同。
图像特征图与生成模型 latent 还需要对齐。空间缩放、视频抽帧和时间插值都会影响压力最终落在哪一层、哪一帧。视觉上合理的热区,如果与生成变量的责任范围错位,仍可能产生误更新。
Redness 实验给这类风险提供了一个很直观的压力测试。错误 Reward 仍会把模型往错误方向推,结构化方法只能减少无差别破坏。它像给更新装上方向盘,却没有替系统决定目的地。
因此,ViPO 更适合被理解为视觉 RL 的新接口,而不是一个独立解决所有对齐问题的模块。Reward 是否可信、PSM 是否看对重点、梯度是否落到真正负责的变量上,三道检查缺一不可。
训练日志应同时保存 PSM 热图与实际梯度分布。只有两者在空间和时间上大致一致,才能确认优势信号真的落到了预期位置。
但方向已经变得清楚:视觉内容的反馈不必永远以一个数字结束。模型若要修好局部问题,训练信号也需要知道“重点”在哪里。
论文原文与引用
本文解读的论文原题为 *Seeing What Matters: Visual Preference Policy Optimization for Visual Generation*。
- 发表信息:CVPR 2026;arXiv:2511.18719v4
Ziqi Ni, Yuanzhi Liang, Rui Li, Yi Zhou, Haibin Huang, Chi Zhang, and Xuelong Li. “Seeing What Matters: Visual Preference Policy Optimization for Visual Gneration.” Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026.
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.