网易首页 > 网易号 > 正文 申请入驻

VinciCoder:多模态统一代码生成框架和视觉反馈强化学习

0
分享至



长期以来,多模态代码生成(Multimodal Code Generation)的训练严重依赖于特定任务的监督微调(SFT)。尽管这种范式在 Chart-to-code 等单一任务上取得了显著成功 ,但其 “狭隘的训练范围” 从根本上限制了模型的泛化能力,阻碍了通用视觉代码智能(Generalized VIsioN Code Intelligence)的发展 。同时,「SFT-only」的范式在确保代码可执行性和高视觉保真度方面存在显著瓶颈 。

在此背景下,中科院 & 美团研究团队推出了 VinciCoder,一个旨在打破 SFT 瓶颈的统一多模态代码生成模型。VinciCoder首次将强化学习的奖励机制从文本域转向视觉域,提出视觉强化学习(ViRL),专攻 SFT 无法解决的视觉保真度难题。

本文提出的系统性框架VinciCoder,通过 “大规模 SFT + 粗细粒度 ViRL” 的两阶段策略,有效统一了从图表、网页、SVG 到科学绘图(LaTeX、化学分子)等多样化代码生成任务 。



  • 论文标题:VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning
  • 论文链接:https://arxiv.org/abs/2511.00391
  • Github 链接:https://github.com/DocTron-hub/VinciCoder

数据代码模型权重已开源。

核心创新与技术突破

该论文同样对传统 SFT 范式的局限性进行了深入分析,发现其关键问题在于训练目标与最终任务之间存在 “视觉鸿沟”:

  • 目标是局部的:SFT 采用自回归的 “下一词元预测” 目标 ,这本质上是局部的,无法为代码 “可执行性” 等全局属性提供监督信号 。
  • 缺乏视觉反馈:模型在训练时完全看不到代码的渲染结果 。这是一个致命缺陷,因为在代码中 “微小的修改就可能导致渲染图像发生巨大变化” 。

这种 “视觉 - 代码” 监督的缺失,直接导致了两个关键问题:

  • 保真度低且不可靠:模型仅在词元层面(token-level)进行优化 ,无法保证渲染出的图像在视觉上与输入对齐,也无法保证代码可以成功执行 。
  • 泛化能力差:依赖特定任务的数据集进行 SFT,难以形成一个统一的多模态代码生成框架 。

考虑到 SFT 的根本局限性,研究者认为必须引入一个能够提供全局视觉反馈的机制。然而,传统的 RL 方法依赖难以泛化的 “基于规则的文本奖励” 。VinciCoder 的破局点在于 ——将奖励机制从文本域彻底转向视觉域

VinciCoder 的核心思路是:用大规模、多样化的 SFT 构建强大的代码基础能力 ,再通过创新的 ViRL 策略专门优化 SFT 无法触及的视觉保真度和可执行性 。训练框架由「1.6M 大规模 SFT 阶段」和「42k 粗细粒度 ViRL 阶段」两部分组成 ,核心是通过两阶段协作,同时实现强大的代码理解与高保真的视觉对齐。

1. 大规模 SFT 语料库与代码优化任务



研究团队首先构建了一个包含1.6M 图像 - 代码对的大规模监督微调(SFT)语料库 。该语料库不仅覆盖了直接代码生成任务,还引入 “视觉代码优化” 的新任务 。在这项任务中,模型会接收到一个目标图像和一个 “有缺陷” 的代码片段(包含逻辑错误或只能部分渲染)。模型的目标是修正这段代码,使其视觉输出与目标图像精确对齐 。这一设计极大地提升了模型在代码层面的纠错和优化能力,为后续的强化学习阶段奠定了坚实基础 。

2. 从 “文本奖励” 到 “视觉奖励”:粗细粒度 ViRL 框架



传统 SFT 训练在多模态代码生成上存在根本缺陷:它缺乏 “视觉 - 代码” 的闭环反馈 ,且无法保证代码的全局可执行性 。

为解决此问题,VinciCoder 引入了视觉强化学习 (ViRL) 框架。该框架摒弃了传统强化学习中脆弱的、基于规则的 “文本奖励” ,转而从视觉直接获取奖励信号 。

其核心突破在于一套粗 - 细粒度(Coarse-to-fine)视觉奖励机制:

  • 渲染与编码:模型生成的代码被实时渲染成图像 。
  • 粗粒度(全局):通过下采样生成缩略图,评估整体结构的相似性 。
  • 细粒度(局部):将高分辨率图像分割为多个局部图块(patches),精确计算局部细节的保真度 。
  • ViT 奖励模型:使用 DINOv2-L 计算渲染图像与目标图像在两个粒度上的视觉相似度,作为奖励信号。
  • 对齐奖励:引入一个辅助的语言对齐奖励,用于惩罚生成了错误代码语言(如要求 Python 却生成了 LaTeX 的行为)
  • 策略优化:采用群组相对策略优化 (GRPO) 算法 对模型进行微调,显著提升视觉对齐度和代码可执行性。

据我们所知,VinciCoder 是第一个应用强化学习(RL)来实现统一视觉代码生成领域中 “跨领域视觉保真度” 提升的视觉语言模型

实验结果与性能表现

论文在五大多模态代码生成基准上进行了全面实验,对比了包括 Qwen、InternVL 等开源模型以及 Gemini-2.5-Pro、Claude-4.5、GPT-5 等闭源模型 ,核心结果如下:



实验结果令人瞩目:VinciCoder 在多个主流多模态代码生成基准上均取得了卓越表现。

  • SOTA 性能:VinciCoder 在开源模型对比中树立了新的 SOTA 标准 ,其性能显著优于所有同等规模的竞争对手 。
  • 媲美闭源模型:在如 Image-to-SVG 和化学分子式生等高难度任务上,VinciCoder 展现出超越顶尖闭源模型的卓越性能 。
  • 策略有效性:消融实验证明,仅 SFT 阶段的 VinciCoder-SFT 就已建立起强大的基线 ;而 ViRL 阶段的引入,则成功将模型性能提升至 SOTA 水平 ,充分验证了 SFT-ViRL 两阶段策略的压倒性优势。



研究意义与应用前景

VinciCoder 的研究不仅在技术上取得了重大突破,也为多模态代码生成领域提供了全新的研究范式:

  • 验证 RL 新路径:证明了 “视觉强化学习” 是突破 SFT 瓶颈、提升代码视觉保真度的有效途径,将奖励机制从文本域成功扩展到视觉域 。
  • 统一框架的实现:打破了过去模型 “各自为战” 的狭隘范式 ,提供了一个强大的统一框架,能够处理包括 Python、HTML、SVG、LaTeX 乃至化学 SMILES 在内的多样化代码生成任务 。
  • 高保真度奖励机制:“粗 - 细粒度” 奖励设计为处理高分辨率、高复杂度视觉输入的 RL 任务提供了健壮且可扩展的解决方案 。

结论

VinciCoder 的核心价值并非单纯地堆砌 SFT 数据,而是通过 “SFT + 粗细粒度 ViRL” 的组合,证明了 “以视觉反馈指导代码生成” 的可行性与优越性。这一思路不仅解决了传统 SFT 范式在可执行性与视觉保真度上的痛点,也为后续通用多模态智能体的研发提供了新的思路。

在总体思路上,该论文的思路与 R1-Style 方法高度相关,都验证了强化学习在提升基础模型高级能力上的巨大潜力。VinciCoder 的成功探索表明,RL 不仅可以用于优化数学推理等文本任务,更可以作为连接 “视觉” 与 “代码” 两大模态的桥梁,解决 SFT 无法企及的跨模态对齐难题。

更多细节请参阅原论文。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
现在有多少存款,才相当于80年代的万元户,看看你达标了吗?

现在有多少存款,才相当于80年代的万元户,看看你达标了吗?

别人都叫我阿腈
2026-05-11 17:29:20
1987年,“独腿英雄”徐良凭《血染的风采》红遍全国,后来怎样了

1987年,“独腿英雄”徐良凭《血染的风采》红遍全国,后来怎样了

比利
2026-05-09 00:28:21
宋祖儿路透曝光,身材干瘪、膝盖骨突出走路崴脚,网友直呼太吓人

宋祖儿路透曝光,身材干瘪、膝盖骨突出走路崴脚,网友直呼太吓人

秋姐居
2026-05-11 16:59:22
新冠后遗症对人体的最大影响,很多人深受其害,有些人还不自知

新冠后遗症对人体的最大影响,很多人深受其害,有些人还不自知

呼吸科大夫胡洋
2026-02-22 11:39:12
文班遭驱逐引热议!恐被联盟追加罚单 名嘴称他很可能被禁赛一场

文班遭驱逐引热议!恐被联盟追加罚单 名嘴称他很可能被禁赛一场

追球者
2026-05-11 09:30:13
场均仅12+6!骑士赢球哈登却高兴不起来,2.69亿内线彻底“隐身”

场均仅12+6!骑士赢球哈登却高兴不起来,2.69亿内线彻底“隐身”

大卫的篮球故事
2026-05-10 15:57:26
晚节不保?72岁濮存昕硬捧外孙女拍戏,全网吐槽:尖嘴猴腮求放过

晚节不保?72岁濮存昕硬捧外孙女拍戏,全网吐槽:尖嘴猴腮求放过

观察鉴娱
2026-05-11 13:57:43
内塔尼亚胡:伊朗战争“还没结束”

内塔尼亚胡:伊朗战争“还没结束”

参考消息
2026-05-11 11:16:11
胜利背后的反思?阿森纳的锋无力该如何解决

胜利背后的反思?阿森纳的锋无力该如何解决

乐道足球C
2026-05-11 17:57:50
拉什福德任意球破门,费兰建功定乾坤,巴萨2-0复仇皇马勇夺29冠

拉什福德任意球破门,费兰建功定乾坤,巴萨2-0复仇皇马勇夺29冠

钉钉陌上花开
2026-05-11 05:10:06
凌晨咳到吐!全国多地中招“干咳毒株”,患者猜疑新冠病毒新变种

凌晨咳到吐!全国多地中招“干咳毒株”,患者猜疑新冠病毒新变种

谭谈社会
2026-05-08 23:19:21
南宋为洗靖康之耻有多狠?700万金人仅剩10万,辱金后还留一画作

南宋为洗靖康之耻有多狠?700万金人仅剩10万,辱金后还留一画作

掠影后有感
2026-05-07 10:01:40
1983年,陈云亲自批示:立即枪毙广东县委书记王仲,原因为何?

1983年,陈云亲自批示:立即枪毙广东县委书记王仲,原因为何?

莫地方
2026-04-20 09:30:18
猛料!义乌外贸公司暴雷,外籍老板已经跑路!

猛料!义乌外贸公司暴雷,外籍老板已经跑路!

无心小姐姐
2026-05-11 03:37:03
惯子如杀子!孩子这几种表现说明已经被惯坏了,再不改就来不及了

惯子如杀子!孩子这几种表现说明已经被惯坏了,再不改就来不及了

木言观
2026-04-29 22:28:49
李嘉诚再谈及未来房价:100万的房子,到2030年还能值多少钱?

李嘉诚再谈及未来房价:100万的房子,到2030年还能值多少钱?

社会日日鲜
2026-05-11 04:52:07
中芯国际张汝京:执着3nm/2nm 是误区 海外垄断利基市场最易突破

中芯国际张汝京:执着3nm/2nm 是误区 海外垄断利基市场最易突破

快科技
2026-05-09 20:16:10
闹大了!女孩首次登门男方家,被安排与男友同床,顾虑声誉要分房

闹大了!女孩首次登门男方家,被安排与男友同床,顾虑声誉要分房

火山詩话
2026-05-09 08:11:39
英超最新积分榜:维拉掉链子,阿森纳惊险绝杀,曼城夺冠希望渺茫

英超最新积分榜:维拉掉链子,阿森纳惊险绝杀,曼城夺冠希望渺茫

足球狗说
2026-05-11 06:19:33
“重达11000克拉”!外媒:缅甸发现迄今为止第二重的“罕见巨型”红宝石

“重达11000克拉”!外媒:缅甸发现迄今为止第二重的“罕见巨型”红宝石

环球网资讯
2026-05-10 11:20:10
2026-05-11 18:47:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
12970文章数 142648关注度
往期回顾 全部

科技要闻

黄仁勋:你们赶上了一代人一次的大机会

头条要闻

外交部介绍特朗普访华具体安排和中方期待

头条要闻

外交部介绍特朗普访华具体安排和中方期待

体育要闻

梁靖崑:可能是最后一届了,想让大家记住这个我

娱乐要闻

“孕妇坠崖案”王暖暖称被霸凌协商解约

财经要闻

多重催化剂共振,人民币汇率升破6.8

汽车要闻

吉利银河“TT”申报图曝光 电动尾翼+激光雷达

态度原创

亲子
数码
健康
房产
公开课

亲子要闻

阿不力挖不力,这是谁的声音?

数码要闻

曜越CT120 EX INFINITY ARGB系列风扇发售,三联包售499元

干细胞能让人“返老还童”吗

房产要闻

产业赋能教育!翰林府与北师大的这场签约,绝不那么简单!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版