网易首页 > 网易号 > 正文 申请入驻

阿里开源视觉大模型Qwen2-VL:可理解20分钟长视频,性能比肩GPT-4o

0
分享至


智东西
编译 Vendii
编辑 漠影

智东西8月30日消息,阿里通义千问于昨日开源新一代视觉语言模型Qwen2-VL。其中,Qwen2-VL-72B在大部分指标上都达到了最优,刷新了开源多模态模型的最好表现,甚至超过了GPT-4o和Claude 3.5 Sonnet等闭源模型。

据官方博客文章介绍,Qwen2-VL基于Qwen2打造,相比第一代Qwen-VL,Qwen2-VL具有以下特点:

1、能读懂不同分辨率和不同长宽比的图片:Qwen2-VL在多个视觉理解基准测试中取得了全球领先的表现,其中包括但不限于考察数学推理能力的MathVista、考察文档图像理解能力的DocVQA、考察真实世界空间理解能力的RealWorldQA、考察多语言理解能力的MTVQA。

2、能理解20分钟以上的长视频:Qwen2-VL可理解长视频,并将其用于基于视频的问答、对话和内容创作等应用中。

3、能够操作手机和机器人的视觉智能体:借助复杂推理和决策的能力,Qwen2-VL可集成到手机、机器人等设备,根据视觉环境和文字指令进行自动操作。

4、多语言支持:除英语和中文外,Qwen2-VL现在还支持理解图像中的多语言文本,包括大多数欧洲语言、日语、韩语、阿拉伯语、越南语等。

通义千问团队以Apache 2.0协议开源了Qwen2-VL-2B和Qwen2-VL-7B,并发布了Qwen2-VL-72B的API。开源代码已集成到Hugging Face Transformers、vLLM和其他第三方框架中。

GitHub项目地址:https://github.com/QwenLM/Qwen2-VL

一、媲美GPT-4o!多个指标刷新最好表现,3种规模模型开源

通义千问团队从6个方面来评估Qwen2-VL分别在72B、7B、2B三种规模上的视觉能力,包括复杂的大学水平问题解决、数学能力、文档和表格的理解、多语言文本图像的理解、通用场景问答、视频理解、视觉智能代理(Visual AI Agent)能力。

整体来看,Qwen2-VL-72B在大部分指标上都达到了最优,甚至超过了GPT-4o和Claude 3.5 Sonnet等闭源模型。

具体而言,该模型在文档理解方面优势明显,仅在复杂的大学水平问题解决方面和GPT-4o还有差距。同时,Qwen2-VL 72B也刷新了开源多模态模型的最好表现。

▲Qwen2-VL-72B模型能力分数比较(图源:通义千问团队官方博客文章)

在7B规模上,Qwen2-VL同样支持单图、多图、视频的输入,在更经济的规模上也实现了有竞争力的性能表现。

比如,Qwen2-VL-7B在DocVQA考察的文档理解能力,以及MTVQA考察的多语言文本图片理解能力都处于SOTA水平。在AI领域,SOTA模型通常是指在特定任务或数据集上性能表现最优的模型。

▲Qwen2-VL-7B模型能力分数比较(图源:通义千问团队官方博客文章)

除此之外,通义千问团队还提供了一个更小的2B规模的模型,以此支持移动端的丰富应用。Qwen2-VL-2B具备完整图像视频多语言的理解能力,特别在视频文档和通用场景问答方面,相较同规模模型优势明显。

▲Qwen2-VL-2B模型能力分数比较(图源:通义千问团队官方博客文章)

二、手写字体、公式代码、网页截屏、视频影像……多场景识别理解不在话下

在官方博客文章列举的多个模型能力案例中,Qwen2-VL覆盖了广阔的应用场景:能识别手写文字、图中文字,能转写数学公式、多种语言文字,能解数学几何题、LeetCode编程题,能读懂不同分辨率和不同长宽比的图片,能用特定格式输出答案,还能对视频内容进行总结和解读。

1、准确识别图中文字,轻松转写数学公式

对于下图列举出来的手写文字、融合在图像中的文字,Qwen2-VL都能准确地识别出对应的语种和文字内容(图中分别涉及到葡萄牙语、中文)。对于下图右下角,Qwen2-VL不只能识别出具体的数字,还能识别出各个数字对应的盒子的颜色。


▲Qwen2-VL能够准确识别图中的文字(图源:通义千问团队官方博客文章)

对于下图左半边中涉及到的复杂数学公式,Qwen2-VL可以轻松地用Markdown格式转写出来。对于下图右半边中涉及到的中文、日语、韩语、西班牙语、葡萄牙语、爱尔兰语、英语、德语、波兰语、希腊语、越南语、蒙古语、俄语、印地语、斯瓦希里语,Qwen2-VL也能一字不落地转录出来。


▲Qwen2-VL能够准确转录图中的复杂公式和多语种(图源:通义千问团队官方博客文章)

2、理解现实世界信息,准确输出问题答案

对于数学平面几何题目、LeetCode平台的编程题目、1792×14400尺寸的技术文档截图,Qwen2-VL也能识别理解并回答用户的提问。


▲Qwen2-VL能够解决的各种问题(图源:通义千问团队官方博客文章)

Qwen2-VL还能基于天气预报软件的截屏、网页搜索结果的截屏、Linux官方档案库的截屏等等抓取用户需要的信息,用特定格式(如表格、段落编号方式、JSON格式的数组)输出。


▲Qwen2-VL回答支持多种格式(图源:通义千问团队官方博客文章)

3、总结视频要点,解读视频内容

此外,除了静态图像,Qwen2-VL还能进行视频内容分析。它能够总结视频要点、即时回答相关问题,并维持连贯对话,帮助用户从视频中获取有价值的信息。

比如下图中,用户上传了一段2分57秒的视频,并让Qwen2-VL描述这段视频,描述的内容非常详细且准确。然后用户提问了视频中人物穿着的衣服的颜色,Qwen2-VL也给到了符合视频内容的回答。


▲Qwen2-VL能够识别视频,并围绕该视频回答相应问题(图源:通义千问团队官方博客文章)

三、实时数据检索+实时环境交互,或将碰撞出更多可能性

据官方博客文章介绍,Qwen2-VL在作为视觉代理方面展现出潜力,能初步利用视觉能力实现一些自动化工具的调用和交互。

视觉代理(Visual Agent)通常指的是一种AI系统,它能够处理和理解视觉信息(如图像或视频),并在此基础上进行决策或执行任务。

Qwen2-VL支持函数调用,使其能够利用外部工具进行实时数据检索,比如航班状态、天气预报、包裹追踪。

▲Qwen2-VL根据用户提供的航班信息调用“weather_hour24”工具查询天气状况(图源:通义千问团队官方博客文章)

通义千问团队还初步做了一些简单的探索,让模型能够更像人一样和环境交互。“使得Qwen2-VL不仅作为观察者,而是能有代替人做更多的执行者的可能。”官方博客文章写道。

在以下视频中,Qwen2-VL可以直接代替人类操作手机。

//oss.zhidx.com/uploads/2024/08/66d1849a8bb52_66d1849a87e91_66d1849a87e69_Qwen2-VL-更清晰地看世界-Qwen1.mp4

▲Qwen2-VL进行视觉交互并自主操作手机(图源:通义千问团队官方博客文章)

以及以下视频中,Qwen2-VL能根据识别到的场上信息和提示词描述进行“24点”游戏的决策,并且取得了胜利。

//oss.zhidx.com/uploads/2024/08/66d183a39e476_66d183a3990d6_66d183a3990b0_Qwen2-VL-更清晰地看世界-Qwen2.mp4

▲Qwen2-VL进行视觉交互并完成纸牌游戏(图源:通义千问团队官方博客文章)

结语:语言能力已经远远不够!模型正在卷向多模态

随着AI技术的飞速发展,语言模型曾一度成为技术竞争的焦点,但自2023年3月15日OpenAI发布了能够读图的GPT-4后,多模态模型的战鼓也是越敲越响。模型不再局限于处理单一的文本数据,而是通过整合图像、视频、音频等多种信息源,展现出更为强大的认知和理解能力。

视觉语言模型是多模态模型领域内的一个重要细分方向。这些模型通过结合计算机视觉与自然语言处理技术,在图像理解、生成及跨模态交互等领域展现出巨大潜力。它们可以被应用于视觉问答(VQA)、图像分类、目标检测、图像分割等多种任务,未来有望在医疗诊断、机器人技术等领域内实现更加广泛的应用。

来源:GitHub

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1976巨震,三位元勋陨落,为何都在这一年?

1976巨震,三位元勋陨落,为何都在这一年?

纪史行者
2026-08-10 21:18:19
2022年林彪女婿葬礼:四大金刚后代合送一个花圈,林豆豆哭成泪人

2022年林彪女婿葬礼:四大金刚后代合送一个花圈,林豆豆哭成泪人

阿器谈史
2025-02-14 10:59:47
事态升级,美国宣告出手,逼中方在黄岩岛认栽,中方做好最坏打算

事态升级,美国宣告出手,逼中方在黄岩岛认栽,中方做好最坏打算

小莜读史
2026-08-12 02:42:47
伊朗不想再拖了,斩首多名“美小弟”后,内塔急下军令,中东变天

伊朗不想再拖了,斩首多名“美小弟”后,内塔急下军令,中东变天

墨策史
2026-08-11 18:34:41
2010年,34岁的罗纳尔多,做了结扎手术。理由是,孩子够多了。

2010年,34岁的罗纳尔多,做了结扎手术。理由是,孩子够多了。

岁月有情1314
2026-08-11 14:42:21
四渡赤水打的是国民党,电影《四渡》居然要和日本IP作战

四渡赤水打的是国民党,电影《四渡》居然要和日本IP作战

凡知
2026-07-02 05:14:46
你有发过横财吗?网友:收了个12块的铜铸件,从此走上人生巅峰!

你有发过横财吗?网友:收了个12块的铜铸件,从此走上人生巅峰!

另子维爱读史
2026-08-05 21:10:45
总经理坚信库里终老勇士:肯定不愿看他申请交易 续约决定权在他手上

总经理坚信库里终老勇士:肯定不愿看他申请交易 续约决定权在他手上

罗说NBA
2026-08-12 06:41:13
黄岩岛这步棋,中国下得恐怕比大家想的都要更深!

黄岩岛这步棋,中国下得恐怕比大家想的都要更深!

吃瓜小侦探
2026-08-12 09:15:20
“毛刘”两家积怨已深?王光美出狱后的3个决定,打破流言蜚语

“毛刘”两家积怨已深?王光美出狱后的3个决定,打破流言蜚语

旧闻档案馆
2026-08-12 10:55:11
炸裂!妻子怀孕期间清华博士出轨:坦言女孩太漂亮,没把持住自己

炸裂!妻子怀孕期间清华博士出轨:坦言女孩太漂亮,没把持住自己

汉史趣闻
2026-08-09 10:32:37
广东揭西县通报人员跳桥事件

广东揭西县通报人员跳桥事件

界面新闻
2026-08-12 07:13:28
闹大了,周星驰问张艺兴:下次我还找你拍戏,零片酬行吗,张艺兴回应显情商,他在片场长时间暴晒,皮肤晒得黝黑,完全褪去了精致妆感

闹大了,周星驰问张艺兴:下次我还找你拍戏,零片酬行吗,张艺兴回应显情商,他在片场长时间暴晒,皮肤晒得黝黑,完全褪去了精致妆感

不二大叔
2026-08-01 11:01:41
房子是有灵性的,若家里出现这7个迹象,便是难得的旺宅

房子是有灵性的,若家里出现这7个迹象,便是难得的旺宅

阿离家居
2026-08-11 01:20:29
河南高速免费范围扩大!豫A豫V豫B豫C豫R,这些条件缺一不可

河南高速免费范围扩大!豫A豫V豫B豫C豫R,这些条件缺一不可

阿莱美食汇
2026-08-12 01:54:58
百花奖后台,一张明星群像抓拍照,暴露内娱的抱团取暖、人情世故

百花奖后台,一张明星群像抓拍照,暴露内娱的抱团取暖、人情世故

胡一舸南游y
2026-08-11 16:10:03
心寒!婚外胚胎案反转,丈夫改口叫朱女士,原配暂缓离婚藏深意

心寒!婚外胚胎案反转,丈夫改口叫朱女士,原配暂缓离婚藏深意

三农老历
2026-08-12 10:07:11
“犹太战神”沙龙:娶亲姐妹为妻,手上沾满鲜血却对中国另眼相待

“犹太战神”沙龙:娶亲姐妹为妻,手上沾满鲜血却对中国另眼相待

古史青云啊
2026-08-11 14:21:39
第一次逛小众莎莎舞厅:开场冷清,最后发现年轻小妹颜值气质在线

第一次逛小众莎莎舞厅:开场冷清,最后发现年轻小妹颜值气质在线

成都人的故事
2026-08-12 11:20:12
血赚!巴萨盯上世界杯冠军功臣!3900 万英超王牌有望空降诺坎普

血赚!巴萨盯上世界杯冠军功臣!3900 万英超王牌有望空降诺坎普

澜归序
2026-08-12 08:52:28
2026-08-12 11:55:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12414文章数 117149关注度
往期回顾 全部

科技要闻

Claude又出骚操作 改个错字也要留AI水印?

头条要闻

灵异探险博主"姜小柔"车祸去世年仅24岁 家属发布说明

头条要闻

灵异探险博主"姜小柔"车祸去世年仅24岁 家属发布说明

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

陈思诚恋情疑云再起

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

本地
手机
旅游
教育
军事航空

本地新闻

黄州一夜,苏轼写给普通人的月光

手机要闻

男子车祸 口袋里小米17 Pro抗下致命一击 弯成折叠屏背屏居然还亮

旅游要闻

看演出、住主题客房、品下午茶,来上海赴一场沉浸式戏旅之约

教育要闻

高中介词短语易混点——“in charge of”到底是“负责”还是“被负责”?一篇讲透!

军事要闻

通过“毕业大考” 湖北舰“持证上岗”

无障碍浏览 进入关怀版