网易首页 > 网易号 > 正文 申请入驻

VisionThink提出视觉令牌压缩新范式,驱动VLM效率革命

0
分享至

始智AI wisemodel.cn社区是源自中国的中立开放的AI开源社区。正在,欢迎加入共同成长。wisemodel推出邀请注册奖励活动,最高可得算力券+token包380元奖励,欢迎参与和支持!

视觉语言模型(VLM)的性能会随视觉令牌数量增加而显著提升,但多数实际场景无需这么多视觉令牌。研究发现,通用视觉问答任务中,即便图像分辨率降至原有的四分之一,模型性能也仅出现轻微下滑;而在涉及细粒度文字识别的任务中,性能下降则十分明显。

针对这一问题,CUHK、HKU和HKUST等机构提出一种全新视觉令牌压缩范式 VisionThink。该范式先对低分辨率图像进行处理,再智能判断这类图像是否足以完成当前任务。若判断结果为不足,模型则会输出特殊的令牌,以此请求高分辨率图像。

相较于传统固定压缩比例的方法,VisionThink 能依据样本内容动态决定是否压缩令牌,既在文字识别任务中维持了出色性能,又在简单任务中大幅降低了计算量。采用强化学习方法,设计 “大型语言模型作为评判者” 的策略,有效优化了模型在通用视觉问答任务中的表现。同时,借助精心构建的奖励函数与惩罚机制,VisionThink 成功实现了稳定且合理的图像调整大小调用比例,广泛的实验表明了本方法的优越性、效率和有效性。模型已更新上线始智AI-wisemodel开源社区,欢迎大家前去体验。

模型地址

https://wisemodel.cn/models/Senqiao/VisionThink-General

01.

瓶颈分析

强化学习是提升大型语言模型推理能力的有效方法,本研究采用组相对策略优化(GRPO)方法,通过组评分估计基线降低计算成本并提高训练稳定性,训练中模型将依据问题构建一组输出,在以 KL 散度约束避免偏离参考模型的同时优化策略以最大化奖励。

而视觉语言模型的计算复杂度主要来自自注意力机制和前馈神经网络,总计算量与 Transformer 层数、序列长度、隐藏层维度及前馈网络中间层大小相关,序列长度由系统提示、图像令牌和问题令牌组成且图像令牌占比最大,因此控制图像令牌数量是提升模型效率的关键,两者形成 “痛点定位 - 技术落地” 的呼应,共同服务于提升视觉语言模型性能与效率的目标。

02.

核心技术框架

VisionThink 旨在开发一种智能高效的视觉语言模型,能够自主判断低分辨率图像是否足以回答问题,其流程为首先处理低分辨率图像,若信息不足则输出特殊令牌请求高分辨率图像,进而降低计算成本并保持性能。

而实现这一目标需解决两个挑战,一是将强化学习有效应用于通用视觉问答,二是让模型准确判断何时需要高分辨率图像;通用视觉问答任务的多样性和复杂性使得传统基于规则的强化学习难以适用,为此提出“大型语言模型作为评判者” 策略,利用大型语言模型的语义理解能力评估模型输出的正确性,评估仅基于文本比较预测答案与真实答案以避免视觉内容干扰,并采用离散评分(0 或 1)减少误判,实验表明该策略显著提升了模型在通用视觉问答任务中的表现,且无需预训练阶段即可直接使用 130,000 个样本进行训练。

VisionThink 通过多轮交互实现动态分辨率处理,首先输入低分辨率图像和问题,若信息不足则模型输出特殊令牌请求高分辨率图像并生成新答案,扩展了 GRPO 算法以支持多轮交互,优化仅基于模型生成的输出令牌,同时采用 Qwen2.5-VL 推荐的代理提示,实验证明其在零样本场景下表现最佳,避免了训练初期因梯度缺失导致的优化失败。

奖励函数包括准确性奖励、格式奖励和惩罚机制,准确性奖励由 “大型语言模型作为评判者” 提供,正确答案得 1 分、错误得 0 分,格式奖励要求模型输出包含推理过程(标签)、最终答案(标签)及正确格式的工具调用(JSON 格式),满分 0.5 分,惩罚机制则防止模型总是请求高分辨率图像或总是直接回答,若低分辨率图像正确回答的概率低则对直接回答施加 0.1 分惩罚,若概率高则对高分辨率请求施加 0.1 分惩罚。

实验表明适当的惩罚阈值(如 0.2)能有效平衡两种行为;为训练模型判断何时需要高分辨率图像,我们收集了 20,000 个样本,包括 10,000 个需要高分辨率图像的样本和 10,000 个可用低分辨率图像回答的样本,使用基线模型 Qwen2.5VL-Instruct 进行多次推理,基于正确率分类样本,确保训练数据覆盖两种场景。

03.

实验结果

我们基于 Qwen2.5-VL-7B-Instruct 模型进行实验,采用 veRL 框架训练,设置批次大小为 512、学习率为 1e-6、生成 16 个候选响应,推理阶段使用 vLLM 框架且温度设为 0,评估覆盖 ChartQA、OCRBench、DocVQA、MME、MMVet、RealWorldQA、POPE、MMMU 和 MathVista 等多个通用视觉问答基准,其中 ChartQA 和 OCRBench 等涉及细粒度文字识别。

VisionThink 在这些基准上表现优异,与基线模型 Qwen2.5-VL-7B-Instruct 相比,其在 MathVerse 和 MMVet 上的得分分别提升 3.7% 和 8.9%,达到 48.0 和 67.1,在 MME 上得分 2400、超越所有闭源模型,在 MathVista 上得分 71.2、优于所有开源模型和部分闭源模型,而使用 130,000 个样本的 “大型语言模型作为评判者” 策略进一步验证了其在通用视觉问答任务中的有效性。

在效率方面,与使用全分辨率图像的 QwenRL 和四分之一分辨率的 QwenRL 1/4 相比,VisionThink 的推理时间接近 QwenRL 1/4、显著优于 QwenRL,在 DocVQA 上其推理速度是 QwenRL 的两倍以上,在 MME 和 POPE 上推理时间减少约三分之一,仅在需要文字识别的 ChartQA 上因请求高分辨率图像而耗时略多,但此类任务占比较少,整体效率仍保持较高水平。

与 FastV、SparseVLM 和 VisionZip 等传统高效视觉语言模型相比,VisionThink 的平均性能更优,尤其在 ChartQA 和 OCRBench 上分别提升 9.0% 和 8.3%,这得益于传统方法依赖固定压缩比例,而 VisionThink 能根据样本内容动态调整分辨率;同时,VisionThink 具备智能决策能力,可自主判断是否需要高分辨率图像,在 ChartQA 和 OCRBench 等需细粒度视觉理解的任务中,高分辨率图像请求比例分别达 79.1% 和 62.3%,而在 MME 和 DocVQA 等任务中,70% 以上样本可直接使用低分辨率图像回答,这种自适应策略符合直觉,日常问题通常无需高分辨率图像,而文字识别任务则依赖细节支撑。

04.

结论

本文介绍了VisionThink,一种用于通用视觉问答(General VQA)的新型范式,旨在提升效率和性能。通过首先处理下采样图像,并在需要时使用强化学习选择性地将其上采样到更高分辨率,VisionThink优化了计算资源,同时保持了准确性。

借助“将大语言模型作为裁判”的策略和定制的 Reward 函数,VisionThink在多种视觉问答基准测试中超越了现有的最先进模型,特别是在需要细粒度细节的任务(如OCR)中表现尤为突出。作者相信VisionThink展示了强化学习在视觉语言模型中的潜力,并鼓励开发更有效率和更高效的AI系统。

在本工作中,作者专注于2倍分辨率提升和最多两次对话的设置,并取得了令人满意的结果。然而,这一方法尚未扩展到灵活分辨率提升的设置。此外,结合更多视觉工具(如裁剪)将进一步提升效率和性能。再者,多轮(例如,超过5轮)图像工具调用在解决复杂视觉问题方面将获得更多收益。

----- END -----

wisemodel相关:

系列模型:

关于wisemodel更多

1

欢迎持续关注和支持

开源社区建设需要长期坚持和投入,更需要广大用户的积极参与、贡献和维护,欢迎大家加入wisemodel开源社区的志愿者计划和开源共创计划。期待更多开发者将开源成果,包括模型、数据集和代码等发布到 wisemodel.cn 社区,共建中立、开放的AI开源社区生态。欢迎扫码添加wisemodel微信,申请加入wisemodel社群,持续关注wisemodel.cn开源社区动态。

2

欢迎加盟wisemodel开源社区

始智AI wisemodel社区自2023年9月上线以来,逐渐成为影响力日益扩大的中立开放的AI开源社区,为了加快公司发展,我们长期需要技术、运营等人才加盟,技术侧重在AI infra、后端开发,熟悉K8S、模型训练和推理等技术, 以及熟悉开发者生态运营的成员,欢迎感兴趣的朋友加盟,可以通过添加wisemodel微信,或者将简历投递到邮箱:liudaoquan@wisemodel.cn

3

欢迎投稿优质内容

欢迎投稿分享人工智能领域相关的优秀研究成果,鼓励高校实验室、大企业研究团队、个人等,在wisemodel平台上分享各类优质内容,可以是AI领域最新论文解读、最新开源成果介绍,也可以是关于AI技术实践、应用和总结等。投稿可以发邮件到liudaoquan@wisemodel.cn,也可以扫码添加wisemodel微信。

4

关于wisemodel开源社区

始智AI wisemodel.cn开源社区由清华校友总会AI大数据专委会副秘书长刘道全创立,旨在打造和建设中立开放的AI开源创新社区,将打造成“HuggingFace”之外最活跃的AI开源社区,汇聚主要AI开源模型、数据集和代码等,欢迎高校科研院所、大型互联网公司、创新创业企业、广大个人开发者,以及政府部门、学会协会、联盟、基金会等,还有投资机构、科技媒体等,共同参与建设AI开源创新生态。

向上滑动查看

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
爵士5年1.575亿美元续约乔治!ESPN评级C+:防守问题突出

爵士5年1.575亿美元续约乔治!ESPN评级C+:防守问题突出

罗说NBA
2026-09-19 05:40:45
一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

怪味历史连连看
2026-09-08 01:55:32
和异性同睡一张床是啥体验?网友:真服了你,你迟早在男女关系上栽大跟头

和异性同睡一张床是啥体验?网友:真服了你,你迟早在男女关系上栽大跟头

解读热点事件
2026-09-18 00:05:10
“孙子非亲生”案舆论持续升级!报失踪就能强制DNA,网友抛出妙招,引发争议

“孙子非亲生”案舆论持续升级!报失踪就能强制DNA,网友抛出妙招,引发争议

火山詩话
2026-09-19 07:38:39
突发:沙特首都遭空袭

突发:沙特首都遭空袭

上观新闻
2026-09-19 08:47:49
不查不知道,一查吓一跳!林丹在西班牙被淹的别墅,到底有多壕

不查不知道,一查吓一跳!林丹在西班牙被淹的别墅,到底有多壕

娱圈办事处
2026-09-18 19:00:28
旧金山男子花$6000买路边广告牌,假装是AI聊天机器人,结果天天干到凌晨

旧金山男子花$6000买路边广告牌,假装是AI聊天机器人,结果天天干到凌晨

北美省钱快报
2026-09-19 05:48:59
脸都不要了!中国男篮惨败日本队,三人要淘汰,郭士强必须下课

脸都不要了!中国男篮惨败日本队,三人要淘汰,郭士强必须下课

宗介说体育
2026-09-18 20:20:54
一个家庭,如果男人比较强势,管教孩子比较严厉,那么他们的子女长大后,一般不会那么叛逆,也很懂事孝顺父母

一个家庭,如果男人比较强势,管教孩子比较严厉,那么他们的子女长大后,一般不会那么叛逆,也很懂事孝顺父母

心灵悦读
2026-09-10 06:59:05
当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

坠入二次元的海洋
2026-09-11 00:35:48
前脚获评“江苏好人”,后脚涉嫌严重违纪违法:“好人校长”姚恒章落马,撕开了什么?

前脚获评“江苏好人”,后脚涉嫌严重违纪违法:“好人校长”姚恒章落马,撕开了什么?

迷世书童
2026-09-18 22:03:12
北约要求检查中国核武!北约:拒绝就是破坏世界和平!解放军回应

北约要求检查中国核武!北约:拒绝就是破坏世界和平!解放军回应

风流女汉
2026-09-18 22:36:30
笑不活了!预制菜店播放炒菜录音,一看后厨阿姨在拆袋叮微波炉

笑不活了!预制菜店播放炒菜录音,一看后厨阿姨在拆袋叮微波炉

柴狗夫斯基
2026-09-18 09:04:59
乌军大规模抗议爆发!泽连斯基承认:俄军随时可以对自己进行斩首

乌军大规模抗议爆发!泽连斯基承认:俄军随时可以对自己进行斩首

观锐器
2026-09-18 12:49:44
中国为何不“收拾”菲律宾,原因很简单,每年乖乖送来2000多亿!

中国为何不“收拾”菲律宾,原因很简单,每年乖乖送来2000多亿!

共工之锚
2026-09-18 00:22:56
家属回应“女子生育后渐失明失聪”:患NF2罕见病,生育前已有症状 医生称极罕见、无普遍性

家属回应“女子生育后渐失明失聪”:患NF2罕见病,生育前已有症状 医生称极罕见、无普遍性

红星新闻
2026-09-18 17:08:22
别再吹世界第一了!1302根柱子,正在悄悄掀翻中国基建的老套路

别再吹世界第一了!1302根柱子,正在悄悄掀翻中国基建的老套路

刘哥谈体育
2026-09-18 01:42:36
外媒记者拿中国挑事,特朗普回应亮了

外媒记者拿中国挑事,特朗普回应亮了

观察者网
2026-09-19 09:31:55
4亿人都在用的豆包,今天成了全网最大的笑话

4亿人都在用的豆包,今天成了全网最大的笑话

财通社
2026-09-17 20:35:18
中美外长级通话后,美国做出最新回应,主动提到台湾问题,不简单

中美外长级通话后,美国做出最新回应,主动提到台湾问题,不简单

兵卒史
2026-09-18 18:32:14
2026-09-19 11:35:00
wisemodel开源社区 incentive-icons
wisemodel开源社区
始智AI wisemodel.cn开源社区,打造中国版“huggingface”
514文章数 16关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

主持人压在女玩家身上贴胸亲吻 网友:剧本杀该管管了

头条要闻

主持人压在女玩家身上贴胸亲吻 网友:剧本杀该管管了

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

蔡卓妍小腹凸起疑怀孕?本人没回应

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

艺术
亲子
本地
旅游
数码

艺术要闻

27幅 著名油画家 冯法祀油画选

亲子要闻

秋季这么运动,娃身高还能窜一窜!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

旅游要闻

昆明人记忆里的亲水滇池回来了

数码要闻

“机顶盒内置”引发网友热议:专家解读一体化电视到底长什么样

无障碍浏览 进入关怀版