来源:滚动播报
(来源:上观新闻)
![]()
![]()
9月1日,杭州联汇科技股份有限公司(简称:OmAI联汇)正式发布视频深度推理模型VLX-VR。该模型在Google DeepMind与哥伦比亚大学联合推出的视频推理基准MINERVA上,以78.8%的视频问答准确率登顶榜首,超越谷歌Gemini 3.5、OpenAI GPT-4.1等国际旗舰模型。VLX-VR同步上线开放体验平台,成为全球首个在“既考答案、又考过程”的视频推理最严基准上“夺冠”的中国模型。
由Google DeepMind与哥伦比亚大学联合推出的MINERVA,被喻为全球视频推理领域的“最严考卷”。该基准包含1000多道取材于真实长视频的推理题目,人类在该基准上的得分为92.5分,而此前全球公开模型的最高成绩为70.7分。
![]()
VLX-VR取得78.8%准确率的同时,推理逻辑一致性(本次评测数据)达96.2%——即模型的推理过程与人类标准推理轨迹的吻合度,表明其不仅答案准确率较高,得出答案的过程也具备可追溯性。
跨时长表现是VLX-VR较为突出的一项特征。测试数据显示,在5分钟以下、5至15分钟、15分钟以上三个时长区间,VLX-VR的准确率分别为76.70%、78.73%和80.92%,随视频时长增加不降反升,跨时长准确率方差(CDAV)为 2.97。作为参考(据MINERVA论文),Gemini 2.5 Pro (Thinking)在15分钟以上视频中的准确率为57.97%,GPT-4.1为47.25%,而VLX-VR打破了行业在长视频理解领域的普遍瓶颈。
此次结果有其技术积累脉络。2025年2月,OmAI联汇在GitHub开源视觉推理模型VLM-R1,首次将DeepSeek-R1的强化学习推理框架引入视觉领域,上线48小时登顶GitHub全球趋势榜。此后一年多时间里,基于"-R1"范式的视觉推理工作在学术界持续推进。从VLM-R1到VLX-VR,同一支团队的研究方向从单帧视觉理解,逐步延伸至长时序视频的推理——理解先后、理解因果、理解变化。作为该公司端侧流式多模态模型VLX家族的最新成员,VLX-VR在VLX“看见、看清、行动”的物理AI闭环之上,进一步延展出面向长视频深度推理的“看懂”能力。
在产业层面,VLX-VR的发布恰逢中国机器人产业标准化进程加速的关键节点。视频推理能力作为物理AI感知世界的基础能力,其技术进展与产业需求的关联正在加深。
“物理AI正大规模走出实验室,进入真实场景。”OmAI联汇CEO赵天成此前在公开场合表示,行业正迎来产业化、规模化拐点。当物理AI的“看懂”能力有了可测量的标准,国产模型在国际权威基准上取得的成绩,标志着中国在视频深度推理这一决定物理AI上限的核心能力上,站到了全球前沿。
原标题:《物理AI产业化观察:OmAI联汇拿下视频推理的全球最高分》
栏目编辑:叶薇 题图来源:采访对象提供 图片来源:采访对象提供
来源:作者:新民晚报 金志刚
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.