网易首页 > 网易号 > 正文 申请入驻

OpenVision 2:大道至简的生成式预训练视觉编码器

0
分享至



本文来自加州大学圣克鲁兹分校(UCSC)、苹果公司(Apple)与加州大学伯克利分校(UCB)的合作研究。第一作者刘彦青,本科毕业于浙江大学,现为UCSC博士生,研究方向包括多模态理解、视觉-语言预训练与视觉基础模型。其余作者包括李先航(UCSC)、张乐天(USCS)、王子瑞(Apple)、郑泽宇(UCB)、周郁音(UCSC)。通讯作者为UCSC的谢慈航教授。

在多模态大模型快速演进的浪潮中,视觉模块一直是支撑整个体系的关键基石。长期以来,CLIP 式的图文对比学习几乎成为视觉预训练的默认思路。从 OpenAI 的 CLIP 到 Google 的 SigLIP,再到一系列开源复现,业界普遍认为:想要获得强大的视觉编码器,就必须依赖对比学习。

近日,来自加州大学圣克鲁兹分校、苹果公司、加州大学伯克利的研究者提出了 OpenVision 2,一种极简的生成式视觉预训练新方向。这项工作在保持最优性能的同时,大幅提升了训练效率,并在生成式框架下实现了 10 亿参数规模的可扩展训练。



✍️论文标题:OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning

论文地址:arXiv:2509.01644

项目主页

https://ucsc-vlaa.github.io/OpenVision2

代码与模型:GitHub · UCSC-VLAA/OpenVision

Hugging Face 模型库:OpenVision 2 on HuggingFace



从 OpenVision 到 OpenVision 2

今年早些时候,研究团队在 ICCV 发布了OpenVision,这是一个完全基于公开数据和开源代码训练的视觉编码器家族,旨在为社区提供真正开放、透明、可复现的视觉骨干。

该项目一次性开源了超过 25 个预训练模型,参数量从590 万到 6 亿+,覆盖多种 patch size 与分辨率设置,成为学术界和产业界构建多模态模型时的重要替代方案。

实验显示,OpenVision 在多个多模态基准任务上已经可以媲美甚至超越 OpenAI 的 CLIP 以及 Google 的 SigLIP,为社区提供了可靠的开源替代。

然而,OpenVision 的训练管线仍然偏复杂。为了充分利用高质量的合成描述,它在 CLIP 的基础上引入了两方面额外设计:

  • 双重对比目标:每张图像既要和 web caption 对齐,又要和部分合成 caption 对齐,导致文本编码器的计算量几乎翻倍,训练成本也随之显著增加。

  • 生成式 caption 预测:模型还需要在图像和原始 alt-text 的条件下,生成完整的合成描述,这进一步增加了解码器的计算开销。

这些设计确实提升了表征质量,但也让训练过程变得更重,计算成本更高,扩展到更大规模时受到明显限制。



极简思路:生成式的 OpenVision 2

在 OpenVision 2 中,研究者们做出了大胆简化:直接移除文本编码器与对比学习,只保留「图像 → 描述」的生成目标。由此形成的框架仅包含两个模块:图像编码器 + 文本解码器。

  • 没有对比学习的双塔结构
  • 没有额外的文本塔开销
  • 依赖高质量合成描述作为唯一监督信号

除此之外,OpenVision 2 还引入了一个关键技巧:在预训练阶段随机丢弃约 2/3 的视觉 token,仅用剩下的 1/3 token 来生成完整描述。

  • 一方面,这大幅减少了文本解码器的计算负担,显著提升了训练效率;
  • 另一方面,这种「稀疏提示」迫使模型在有限条件下仍要还原出完整的 caption,从而提升了表征的抽象能力。

这种「以少胜多」的思路,使得 OpenVision 2 在保持性能的同时实现了更高的效率,也印证了「少即是多」的理念。

实验表明,这一简化设计不仅没有削弱模型能力,反而在效率与扩展性上表现突出:

  • 性能:在 TextVQA、ChartQA、OCR、MME 等主流多模态基准上,OpenVision 2 与 OpenVision 几乎持平,甚至在部分细粒度任务上表现更佳。同时,相较于 OpenAI-CLIP、LAION-CLIP、MetaCLIP 等主流对比学习模型,OpenVision 系列在同等规模下整体表现更强,特别是在 OCR 与文本相关任务上优势明显。





  • 效率:训练时间缩短1.5——2 倍,显存占用减少近一半,单卡批大小从 2k 扩展到 8k;例如,在 ViT-L/14 上从约 83 小时缩短到 57 小时,在 SoViT-400M 上从约 241 小时缩短到 121 小时。这些改进使得模型在生成式框架下成功扩展到10 亿参数规模,并保持高效训练,也为进一步探索更大规模的生成式视觉预训练奠定了基础。



为什么有效?

研究者总结了 OpenVision 2 作为生成式视觉编码器能够成功的三点关键原因:

  • 生成式监督更贴近下游:生成任务与多模态大模型(如 LLaVA)的推理方式一致,减少了预训练与下游任务间的「目标错位」。

  • 高质量合成描述:在 Recap-DataComp-1B v2 中,caption 的生成同时结合了图像和原始文本,使得描述更细致、更贴合语义,为预训练提供了更可靠的监督信号。

  • 视觉 token 随机掩码(少即是多):仅保留部分视觉 token 进行生成,既降低算力开销,又让模型在「信息不完整」的条件下学会抽取核心特征,从而提升泛化与鲁棒性。



对社区的意义

OpenVision 2 展示了一个重要事实:对比学习并非不可或缺。通过生成式的简洁框架,同样能够训练出强大的视觉编码器,并在效率和可扩展性上具备显著优势。

这项研究不仅挑战了长期以来的对比学习主导范式,也为未来多模态基础模型的发展提供了新的方向。正如作者们所强调的,「大道至简」的设计理念,展示了生成式视觉预训练在未来发展的潜力。

从 OpenVision 到 OpenVision 2,研究团队已经开源了超过 25 个不同规模和配置的模型,并完整公开了训练代码与数据管线,为学术界和产业界提供了可复现、可扩展的资源基础,加速社区在生成式视觉预训练方向上的探索。研究团队长期欢迎学界和业界的同学和朋友联系、交流、合作。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
风向变了?听风的蚕突然掉粉1600万

风向变了?听风的蚕突然掉粉1600万

老吴教育课堂
2026-02-04 03:25:59
哈登1换2交易评级:骑士获强援冲冠评A 快船实力降级仅评C

哈登1换2交易评级:骑士获强援冲冠评A 快船实力降级仅评C

罗说NBA
2026-02-04 10:17:35
中美彻底变天了?中方正式向全世界宣布,禁止美军该项合作

中美彻底变天了?中方正式向全世界宣布,禁止美军该项合作

爱吃醋的猫咪
2026-02-02 19:48:11
伊朗果然好猛:美航母开了第一枪,事后伊方一句话让美方细思极恐

伊朗果然好猛:美航母开了第一枪,事后伊方一句话让美方细思极恐

东极妙严
2026-02-04 12:46:10
1-3到5-3!吴宜泽开门红,张安达爆冷世界冠军,丁俊晖破百救赛点

1-3到5-3!吴宜泽开门红,张安达爆冷世界冠军,丁俊晖破百救赛点

刘姚尧的文字城堡
2026-02-03 22:30:13
男人切记:搞定女人的“千古定律”,只有一条,屡试不爽!

男人切记:搞定女人的“千古定律”,只有一条,屡试不爽!

云端小院
2026-01-31 08:59:12
官宣!第六笔交易达成,武切维奇加盟绿军,史蒂文斯还有操作!

官宣!第六笔交易达成,武切维奇加盟绿军,史蒂文斯还有操作!

体育大朋说
2026-02-04 09:10:18
具俊晔为大S雕像取名《熙媛的永恒轨道》,设计过程全部公开

具俊晔为大S雕像取名《熙媛的永恒轨道》,设计过程全部公开

素素娱乐
2026-02-02 17:03:27
20年前,张冕为护胡歌离世,胡歌许诺赡养其父母,如今他做到了吗

20年前,张冕为护胡歌离世,胡歌许诺赡养其父母,如今他做到了吗

科学发掘
2026-02-04 02:44:46
难怪哈登要离开!快船太过分,骑士送上两大利好,或将终老克城!

难怪哈登要离开!快船太过分,骑士送上两大利好,或将终老克城!

你的篮球频道
2026-02-04 12:52:54
谷爱凌不再回避!坦言“世界不会原谅我了”,彻底走上朱婷的老路

谷爱凌不再回避!坦言“世界不会原谅我了”,彻底走上朱婷的老路

有范又有料
2026-01-29 16:02:11
28亿!字节跳动拿下大钟寺地块

28亿!字节跳动拿下大钟寺地块

选址中国
2026-02-03 15:59:42
小米SU7 Ultra专属销售团队“解散”

小米SU7 Ultra专属销售团队“解散”

电动知家
2026-02-04 10:22:22
华北奇怪司令:没打过多少硬仗,为何军衔比名将郑维山还高?

华北奇怪司令:没打过多少硬仗,为何军衔比名将郑维山还高?

秀心文雅
2026-02-04 09:25:13
央视《太平年》首播差评如潮,观众理由出奇一致:完全摸不着头脑

央视《太平年》首播差评如潮,观众理由出奇一致:完全摸不着头脑

小娱乐悠悠
2026-01-24 13:12:22
一记耳光,谢苗《东北警察故事3》票房破1000万,笑不出来!

一记耳光,谢苗《东北警察故事3》票房破1000万,笑不出来!

君笙的拂兮
2026-02-03 16:30:33
以总理会美特使 要求对伊朗“行动自由”

以总理会美特使 要求对伊朗“行动自由”

环球网资讯
2026-02-04 07:19:11
朱高炽在位不足一年 ,为何能青史留名?他解决了三个天大的难题

朱高炽在位不足一年 ,为何能青史留名?他解决了三个天大的难题

千秋文化
2026-01-21 20:55:53
国家卫健委明确医院转型方向,临床医学遇冷,两大专业迎发展机遇

国家卫健委明确医院转型方向,临床医学遇冷,两大专业迎发展机遇

金哥说新能源车
2026-02-04 04:12:42
具俊晔休息室崩溃痛哭!纸上写满「熙媛啊..」40年好友一看心碎了

具俊晔休息室崩溃痛哭!纸上写满「熙媛啊..」40年好友一看心碎了

ETtoday星光云
2026-02-04 09:39:11
2026-02-04 13:27:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
12248文章数 142562关注度
往期回顾 全部

科技要闻

太烦人遭投诉!元宝红包链接被微信屏蔽

头条要闻

卡扎菲儿子被暗杀身亡:4名蒙面人员闯入住所激烈交火

头条要闻

卡扎菲儿子被暗杀身亡:4名蒙面人员闯入住所激烈交火

体育要闻

“也许我的一小步,会成为中国足球的一大步”

娱乐要闻

姜元来在大S墓碑前哭泣,与具俊晔拥抱

财经要闻

35岁入行,先被考证“割韭菜”

汽车要闻

全伪装雪地现身 一汽-大众纯电车型线索曝光

态度原创

时尚
本地
游戏
公开课
军事航空

状态比10年前更好,她到底做对了什么?

本地新闻

云游中国|拨开云雾,巫山每帧都是航拍大片

真有你的啊!SE EPIC限时特卖SE多款大作1.5折

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普:庞大兵力将很快抵达伊朗

无障碍浏览 进入关怀版