![]()
上个月跟几个做具身的朋友聊,说现在机器人最大的问题不是腿脚不灵活,是眼睛看了白看。
一个视频丢进去,模型能认出来画面里有几个人、什么颜色,但问它这些人接下来要干什么、为什么会这样、五分钟前那个动作和现在这个结果之间是什么关系,基本靠蒙。
这话说完没多久,OmAI联汇把VLX-VR丢出来了。
![]()
GitHub:https://github.com/om-ai-lab
78.8分。在MINERVA这个由Google DeepMind和哥伦比亚大学联合打造的基准上,直接登顶。
此前,全球公开模型的最高成绩是70.7分。
Gemini 2.5 Pro Thinking在这个榜上66.2%,OpenAI o1 43.48分,GPT-4o 45.54分。
更关键的是,VLX-VR不是靠取巧刷出来的高分,MINERVA这个基准,跟市面上绝大多数VideoQA评测有个本质区别——
它不只考核最终答案对不对,它要求模型给出推理过程。
很多模型在选择题上能蒙对,但推理逻辑一塌糊涂,这在MINERVA上行不通。
在答对样本中,按内部定义的参考推理轨迹对照指标,VLX-VR输出跟人工参考轨迹的一致性达到96.2%,表明VLX-VR的思考轨迹高度接近人类。
答案对不算本事,怎么得出这个答案的才是本事。
01越长越强,这事反直觉但真实发生了
测试过不少视频模型,一个普遍规律是视频越长模型表现越拉胯。
三五分钟的短视频还能应付,拉到十五分钟以上,准确率直接跳水。
VLX-VR,它在三个时长区间的表现是这样的:5分钟以下76.70%,5到15分钟78.73%,15分钟以上80.92%。
时间越长,准确率越高。跨时长准确率方差只有2.97。
![]()
这个数据放在整个行业里看,几乎是反物理的。
作为对比,Gemini 2.5 Pro在15分钟以上视频中的准确率是57.97%,GPT-4.1是47.25%。
是很显著的数据优势。
我专门去看了MINERVA的论文,这个基准里每道题都配有手写的推理轨迹,题目设计就是冲着多步推理去的。
一个模型要在这种测试里拿到高分,光靠模式识别和语言偏见根本行不通。
它必须真正理解视频里发生了什么、为什么发生、接下来可能发生什么。
VLX-VR能逆势上扬,说明它的架构设计从一开始就不是冲着短视频优化去的。
传统视频模型把视频当图片序列处理,帧与帧之间的时序关系是靠后处理硬凑的。
这个差异在长视频场景里会被无限放大。短视频里信息密度高但时序短,模型靠单帧特征就能蒙个七七八八。
长视频考验的是信息筛选和因果链条的构建能力,这才是视频推理真正的难点。
02从文本推理到视频推理,中间隔着一道鸿沟
OpenAI o1在文本推理上有多强不用我多说,复杂数学题、代码生成、逻辑推理,o1都是顶尖水平。
但到了视频推理这个赛道,43.48分。GPT-4o稍微好一点,45.54分。
这不是OpenAI技术不行,是视频推理和文本推理压根不是一回事。
文本推理处理的是符号化的信息,语言本身已经被高度抽象和结构化。
模型要做的就是在这个符号系统里找规律、做推导。
视频推理面对的是原始视觉信号,没有现成的符号体系,模型得先搞明白画面里有什么、这些东西在干什么、时间线上发生了什么变化,然后才能谈得上推理。
更麻烦的是,视频里的因果关系往往是隐式的。
一个人拿起杯子,可能是因为渴了,可能是因为要喝水吃药,也可能只是把杯子挪个位置。文本里这些信息通常会被明确表述出来,视频里全靠模型自己判断。
VLX-VR能在MINERVA上拿到78.8分,说明它在从视觉信号到因果推理这条链路上打通了关键环节。
![]()
96.2%的推理逻辑一致性进一步印证了这一点——它不是靠运气蒙对的,是真的想明白了。
但我也得说句实话。92.5分的人类基准摆在那里,VLX-VR距离真正的人类水平还有不小的差距。
官方文档里也老老实实承认了,计数、状态变化、空间感知这些方面仍有优化空间。
这种坦诚在现在的AI行业里不多见,值得给个赞。
03物理AI的底层能力正在被重新定义
VLX-VR选在这个时间点发布,很有意思。
8月24日,工信部公示了国家人形机器人产业标准体系建设指南征求意见稿。
8月26日,工信部在国新办发布会上把具身智能列为未来产业方向。整个产业界对物理AI的关注度到了一个前所未有的高度。
但关注归关注,技术能不能跟上是另一回事。
机器人也好,智能终端也好,想要在真实世界里干活,前提是能看懂这个世界在发生什么。
不是看个大概,是精确理解时序先后、因果关系、动态变化。VLX-VR解决的就是这个前置问题。
![]()
OmAI联汇给VLX家族画了一条完整的能力链路:
Flow负责流式感知,让模型像人一样持续观察环境而不是被动等待提问;Seek负责精准定位,把坐标生成转化为区域检索;
VR负责深度推理,处理那些需要慢思考的复杂视频理解任务;
Go负责行动执行,直接把视觉理解转化成机器人可执行的轨迹。
这套分工的逻辑很清楚:快思考交给Flow和Go,慢思考交给VR。
一个物理世界的AI系统不可能所有任务都用同一套推理机制,有些事需要即时响应,有些事需要深度思考。
VLX把这两者拆开了,各自优化。
我试用了一下他们的体验平台(https://om-agent.cn/#/front),几个场景跑下来,Flow的实时响应确实快,VR在复杂推理场景下的表现也超出了我的预期。
当然体验是一回事,真正落地到机器人上还有很长的路要走。但这个方向是对的——让AI从看懂视频走向看懂物理世界。
04
视频推理这个赛道,之前的格局一直是Google和OpenAI领跑,其他人在后面追。
VLX-VR在MINERVA上的表现,至少在基准测试这个维度上,把格局打破了。
但我想说的是,榜单第一不重要,重要的是为什么能第一。
VLX-VR聚焦长视频的多步复杂推理,串联时间定位、证据提取与多步逻辑,实现了生成效果的显著进化。
![]()
这些技术选择的背后,是对物理AI这个方向的长期判断:AI终归要从屏幕走向真实世界,而真实世界的要求跟实验室里完全不一样。
时间是连续的,环境是动态的,终端算力是受限的。云端大模型再强,放到真实场景里也得面对这三个刚性约束。
VLX从一开始就是围绕这些约束设计的,不是把云端模型压缩后塞进终端。
物理AI规模化应用的拐点是不是真的来了,我现在不敢下定论。
但有一点是确定的:视频推理作为物理AI感知世界的基础能力,正在从学术问题变成工程问题,从实验室走向真实场景。
VLX-VR在这个节点上给出了一份超出预期的答卷,接下来就看它能不能在真实世界里跑起来了。
![]()
体验地址放这儿了:
https://om-agent.cn/#/front
![]()
朋友圈会发一些具体的案例和商业化日常~
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.