网易首页 > 网易号 > 正文 申请入驻

上海AI Lab与浙大EagleLab推出RRVF,助力视觉推理新突破。

0
分享至

本本研究由上海AI Lab前沿探索中心石博天老师带领的数据前沿团队、浙江大学EagleLab和上海创智学院等单位联合完成。第一作者陈杨是浙江大学硕士生,研究方向为多模态大模型和推理,本工作完成于她在上海AI Lab实习期间,实习所在团队以Agent-Ready的知识为核心,实现「提取->结构化->推理」全链路,包括基于MLLM的文档理解、基于异质图网络的多模态知识表征、自主终身学习智能体等。论文共同第一作者、通讯作者沈宇帆就职于上海AI Lab,正在全身心探索下一代 MLLM 学习范式和高效的多模态智能体。论文的共同通讯作者于智是浙江大学 EagleLab 副教授,曾任浙大 ACM 教练并执教获世界总冠军。功成身退之后,长期致力于用 AI 改善残障人群生活,在信息无障碍和人工智能领域有深厚造诣。

一个任务有多容易被 AI 解决?最终可能只取决于一个简单的问题:它的答案有多容易被验证?

这,就是验证非对称性(Asymmetry of Verification)—— 一个古老但正在重塑 AI 未来的深刻原则。它的核心思想是:对很多任务而言,验证一个解的好坏,远比从头创造一个解要容易得多

这一思想,正是近期从 OpenAI 跳槽至 Meta 的思维链(CoT)开山作者 Jason Wei 在其最新博客中提出的「验证者法则」(Verifier's Law)的基石。他断言:「所有可能被解决且易于验证的任务,都将被 AI 解决。」

为什么?因为一个任务如果具备客观真理、可快速验证、可规模化验证、低噪音、连续奖励等特性,就相当于为强化学习(RL)创造了一个完美的训练场。AI 可以在这个场中进行海量的、高效率的「猜测 - 检验」(guess-and-check),通过不断的迭代优化,最终逼近最优解。

而这一法则的最佳实践,已经悄然出现在了多模态领域。上海AILAB和浙江大学EagleLab的最新研究RRVF(Reasoning-Rendering-Visual-Feedback),就完美诠释了如何利用「验证的非对称性」来攻克复杂的视觉推理难题。

  • 论文标题:Learning Only with Images: Visual Reinforcement Learning with Reasoning,Rendering,and Visual Feedback
  • 论文地址:https://arxiv.org/pdf/2507.20766

RRVF:Image2code 的「验证者法则」训练场

在传统 AI 训练中,我们依赖昂贵的「图像 - 文本」配对数据来教模型进行视觉推理。这不仅成本高昂,而且很多时候限制了 AI 的创造力,例如使用特定的 code 来训练还原 image。

图 1: RRVF vs 通用训练方法,只需输入图片,利用推理、渲染、反馈进行强化学习

RRVF 框架则另辟蹊径,它没有去教模型「怎么做」,而是构建了一个让模型可以自我验证的环境。RRVF 的全称是「Reasoning-Rendering-Visual-Feedback」(推理 - 渲染 - 视觉反馈),这三个词精准地概括了其核心工作流。它构建了一个端到端优化的闭环系统,让模型在「自我纠正」中学习。

图2: RRVF框架图

第一步:迭代式视觉推理 (Iterative Visual Reasoning)

  • 面对一张目标图像(如数据图表),它会进行迭代式多轮思考。在每一轮,模型都会在 < think > 中先写下自己的思考过程,然后调用外部工具进行渲染和获取反馈,在后续轮次中根据反馈修正自己的代码。

图 3: 迭代视觉推理算法

第二步:视觉反馈 (Visual Feedback)

  • 外部工具(如 Matplotlib 或 Playwright 浏览器)执行代码后,会渲染生成图片。此时,一个更强大的「视觉裁判」模型(论文中使用了 72B 的 Qwen2.5-VL)会介入,对比渲染图和原图,并生成定性的、结构化的自然语言反馈,例如:「图表类型正确,但颜色不匹配」、「网页布局基本正确,但缺少了一个按钮」。这些反馈会作为新的输入,指导模型进行下一轮的代码修正。

第三步:视觉裁判 (Visual Judge) & 混合奖励

  • 在整个迭代过程结束后,模型会输出最终的代码。此时,「视觉裁判」会再次出场,但这次它扮演的是「法官」角色,给出一个定量的视觉相似度分数R_vision。
  • 但仅仅有视觉分是不够的。为了让模型学得更好,研究者设计了混合奖励函数 (Hybrid Reward Design)
  • 视觉相似度奖励 (R_vision):核心奖励,分数越高奖励越大。
  • 格式正确性奖励 (R_format):代码能否跑通?思考和工具调用的格式对不对?如果出错,直接给予惩罚。
  • 工具使用奖励 (R_tool):为了鼓励模型探索和使用反馈循环,每次成功的工具调用都会获得少量奖励,直到模型表现得足够好(视觉分超过 0.95)或达到最大次数。

这三个奖励通过加权组合(R = w_v * R_vision + w_f * R_format + w_t * R_tool),构成最终的驱动力。

最后一步:GRPO 算法优化

  • 有了精确的奖励信号,如何高效地更新模型?RRVF 采用了GRPO(Group Relative Policy Optimization)算法。相比传统的 PPO,GRPO 更高效,它不需要一个独立的价值函数,而是通过对一组(论文中是 8 个)候选答案进行比较和打分,直接优化策略。

这个设计,完美地将一个复杂的「代码生成」任务,转化成了一个极易被验证(视觉相似度)和优化(混合奖励 + GRPO)的工程问题。

图 4:迭代推理的 case,模型一步步学会如何准确重建一张饼图

实验结果:验证的力量,让 7B 模型超越 72B 老师

RRVF 的实验结果,有力地证明了「验证者法则」的力量。模型基于Qwen2.5-VL-7B进行训练,并在图表生成(ChartMimic, Plot2Code)和网页生成(WebSight)三个数据集上进行了全面评测。

1. 性能碾压:SFT 学的是「模仿」,RRVF 学的是「理解」

在 ChartMimic 上,传统的监督微调(SFT)虽然有标准代码答案,但执行率只有 69.00%。而 RRVF 在没有任何代码答案的情况下,代码执行率达到了97.83%,在其他各项指标上均有明显提升。这证明了 RRVF 真正理解了图像的结构,而非死记硬背。

2. 「学生」超越「老师」:自学习效应的惊人体现

出乎意料的是,通过 RRVF 训练的 7B 模型,最终的综合得分(64.36)不仅远超其基础模型(38.17),甚至超越了在训练中为它提供反馈和评分的、更强大的 72B 模型(47.30)。这证明 RRVF 不是简单的知识蒸馏,而是让模型在自我探索中发现了比「老师」更优的策略,实现了能力的「进化」。

3. 泛化能力:真学霸从不畏惧新考卷

为了考验模型是否真的学到了通用能力,研究者在未训练的 Plot2Code 数据集上进行了零样本测试。结果显示,SFT 模型性能急剧下降(例如执行率从 69% 暴跌至 49%),暴露出其「偏科」和「过拟合」的本质。

相比之下,RRVF 模型的执行率几乎没有衰减(例如执行率从 97.83% 稳定在 96.21%)。这强有力地证明,通过视觉反馈学习到的,是可迁移的、底层的视觉到代码的生成逻辑。

这项研究是「验证者法则」的一次响亮宣告。它告诉我们,未来 AI 发展的瓶颈,可能不在于模型本身有多大,而在于我们能否为 AI 想解决的任务,设计出足够简单、高效的「验证环境」。

一旦我们学会了如何将复杂问题转化为易于验证的问题,那么正如 Jason Wei 所预言的,一个智能的「锯齿状前沿」将会出现:在所有可被清晰验证的领域,AI 将展现出超乎想象的强大能力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
迟来的清算!叙利亚三兄弟被捕,战争血债终于要偿还

迟来的清算!叙利亚三兄弟被捕,战争血债终于要偿还

果妈聊娱乐
2026-08-06 10:17:08
太丢人!王皓与球迷发生冲突内幕曝光!

太丢人!王皓与球迷发生冲突内幕曝光!

乒乓乐园
2026-10-04 08:01:45
双赢策略:如何“提升”性生活的“质量”,让双方都达到巅峰

双赢策略:如何“提升”性生活的“质量”,让双方都达到巅峰

精彩分享快乐
2026-08-31 21:18:49
血糖高不能喝牛奶,再三提醒:要想保护胰岛,牢记4吃、3不吃

血糖高不能喝牛奶,再三提醒:要想保护胰岛,牢记4吃、3不吃

普陀动物世界
2026-10-04 12:15:28
当年花钱买“农转非”城镇户口的人,现在后悔了吗?

当年花钱买“农转非”城镇户口的人,现在后悔了吗?

智慧生活笔记
2026-10-04 10:11:25
大案纪实:天才诗人的嗜血假面:内地连环杀人案始末 比顾城偏执百倍的人间恶魔

大案纪实:天才诗人的嗜血假面:内地连环杀人案始末 比顾城偏执百倍的人间恶魔

大案纪实故事
2026-10-02 09:30:33
悲催!浙江一男子8000元创业,半年狂赚130万,终陷千万负债,网友:普通人要明白一个道理,发财了不是你牛逼,是你站在风口上

悲催!浙江一男子8000元创业,半年狂赚130万,终陷千万负债,网友:普通人要明白一个道理,发财了不是你牛逼,是你站在风口上

火山詩话
2026-09-04 06:12:16
收手吧“资本家的丑孩子”!没颜值没演技,就别出来祸祸观众了

收手吧“资本家的丑孩子”!没颜值没演技,就别出来祸祸观众了

全球风情大揭秘
2026-10-02 20:19:03
今天是10月4日,国庆假期第四天。关于2026年退休人员基本养老金调整,有4个“没想到”。

今天是10月4日,国庆假期第四天。关于2026年退休人员基本养老金调整,有4个“没想到”。

骑驴追光者
2026-10-04 11:14:41
中国大满贯首轮冷风猛!日本男单两大种子全出局,薛飞1-3止步,张禹珍让2-3逃生,何卓佳3-0爆冷

中国大满贯首轮冷风猛!日本男单两大种子全出局,薛飞1-3止步,张禹珍让2-3逃生,何卓佳3-0爆冷

篮球热嗖
2026-10-04 19:14:15
女儿昨晚打来了电话,我心里难受极了,结婚才两年的女婿已经去起诉了,要和她离婚

女儿昨晚打来了电话,我心里难受极了,结婚才两年的女婿已经去起诉了,要和她离婚

艺鉴在线
2026-10-05 01:03:38
山东省委、山东省人民政府致贺电

山东省委、山东省人民政府致贺电

政知新媒体
2026-10-04 21:47:05
德赫亚发布社媒:德约科维奇是史上最佳运动员?

德赫亚发布社媒:德约科维奇是史上最佳运动员?

懂球帝
2026-10-04 22:17:18
周杰伦青岛演唱会破纪录

周杰伦青岛演唱会破纪录

东方不败然多多
2026-10-04 14:01:12
“性成瘾”是什么?患者自白:比烟瘾、酒瘾厉害多了,比戒毒还难

“性成瘾”是什么?患者自白:比烟瘾、酒瘾厉害多了,比戒毒还难

健康之光
2026-07-28 13:04:55
刘思齐晚年坦白:毛岸英入朝之前,曾反复问过毛主席一个问题!

刘思齐晚年坦白:毛岸英入朝之前,曾反复问过毛主席一个问题!

凡人侃史
2026-10-04 17:37:32
莫言:如果你混到没人找你吃饭,没人喊你聚会,连电话也没几个,那庆祝了,你不是人缘变差,而是真正觉醒了

莫言:如果你混到没人找你吃饭,没人喊你聚会,连电话也没几个,那庆祝了,你不是人缘变差,而是真正觉醒了

品读时刻
2026-05-27 09:00:58
不弹劾了?支持率跌破31%:中期选举一赢,特朗普全家一个都别跑

不弹劾了?支持率跌破31%:中期选举一赢,特朗普全家一个都别跑

顾秋韵
2026-10-03 14:08:51
WTT中国大满贯,日本3位亚运会主力一轮游,国乒男队集体抵制饭圈

WTT中国大满贯,日本3位亚运会主力一轮游,国乒男队集体抵制饭圈

老汆古装影视解说
2026-10-04 18:24:33
笑死,这就是中年夫妻旅游现状吗?网友:出门必吵

笑死,这就是中年夫妻旅游现状吗?网友:出门必吵

夜深爱杂谈
2026-08-02 19:19:06
2026-10-05 04:59:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14123文章数 142744关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

体育要闻

32胜0负!德约2-1逆转头号种子兹维列夫 第7次晋级中网四强

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
游戏
手机
教育
公开课

艺术要闻

震惊!吴冠中为何把自己的画展叫“叛徒画展”?真相远比你想的扎心!

《战争机器》新作恐怖感拉满!怪物直扑玩家脸

手机要闻

iPhone18 Pro:首销破百万,国产旗舰首销总和不到人一半!

教育要闻

家长注意:节假日期间,南京多所学校体育场对外开放!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版