![]()
这项由北京交通大学与字节跳动联合开展的研究发表于2026年7月,论文编号为arXiv:2607.12800,发布时间为2026年7月14日,有兴趣深入了解的读者可以通过该编号在arXiv平台上查询完整论文。
你有没有想过,当你第一次做一道从未尝试过的菜时,你是怎么"思考"的?你不会先把菜谱背成文字再一句一句翻译成动作,而是直接在脑海里"放电影"——先看到切菜的画面,再看到热锅的蒸汽,然后是翻炒的动作,最后是装盘的成品。整个过程几乎没有语言参与,纯粹是画面对画面的推演。这种能力,人类天生就有,而现在的AI却几乎完全做不到。
现有的人工智能系统,哪怕是最先进的那些,本质上都是"文字思考者"。它们学习世界知识的方式是阅读海量文本,推理的方式是在文字空间里组织逻辑,就连处理图像和视频,也要先把视觉信息"翻译"成语言描述,再在文字层面做判断。这就好比一个从未亲眼见过厨房的人,靠着读菜谱来指挥别人做饭——文字描述再详尽,也难以捕捉"火候"那一瞬间的微妙变化,更别提锅铲翻转时食材的具体形态。
北京交通大学与字节跳动的研究团队正是看到了这个根本性的缺口,于是提出了一个大胆的问题:能不能训练AI直接在视觉空间里思考、规划和推理,就像人类用眼睛和大脑配合一样,完全不依赖文字的中转?围绕这个问题,他们构建了一套完整的研究体系,核心成果被命名为UniVR,这也是人工智能领域首次系统性地探索"纯视觉空间推理"这一方向。
一、文字思考的天花板:为什么现有AI总在视觉任务上碰壁
要理解UniVR的价值,首先得明白现有AI系统在视觉推理上究竟卡在哪里。
目前主流的做法大致分两类。第一类是让大语言模型(可以理解为超级强大的"文字专家")先生成详细的文字步骤描述,然后再把这些文字描述交给图像生成模型,让后者把每一步"画出来"。比如,要让AI展示"如何把衬衫挂到衣架上",文字专家会先写出"第一步,展开衬衫;第二步,找到衣领位置;第三步,将衣领套入衣架钩子……",然后图像模型再根据这些文字一张一张地生成图片。
这个流程听起来合理,但实际上问题很多。文字描述天然就是对视觉世界的粗糙抽象,它根本无法精确传达"绳子绕过去那一刻的张力变化"或者"布料在空中飘动时的褶皱形态"。结果就是,哪怕文字描述写得再精确,最终生成的图像序列也会出现逻辑断裂——前一帧衬衫还是平铺的,下一帧突然就挂好了,中间那个让衣服"飞起来"套上去的过程完全消失。更麻烦的是,随着语言模型越来越强大,这个问题并没有显著改善,因为瓶颈根本不在语言理解能力,而在于从文字到视觉的转译本身就是一堵墙。
第二类做法是直接用视频生成模型来处理视觉任务,让模型从视觉数据中直接学习策略。这个方向思路上更对,但现有的视频生成模型要么只能处理短时间的简单动作,要么只能专注于单一类型的任务,一旦面对需要长时间、多步骤、跨领域的复杂场景,就会原形毕露。而且,这类模型在训练和推理时,往往还是需要大量图文配对数据作为辅助,并未真正摆脱对文字的依赖。
正是在这两条路都走到局限的情况下,研究团队选择了一条更根本的路:让模型直接从原始视觉数据中学习,在纯粹的视觉空间里完成推理和规划,不需要文字作为中介,也不需要专门针对每种任务设计规则。
二、搭台子:VR-X基准测试,给"视觉思考"定一把尺
要研究视觉推理能力,首先得有一把合适的尺子来衡量。研究团队发现,现有的测试基准大多只关注图像质量有多好看,或者生成结果与文字描述匹不匹配,根本没有认真评估AI是否真正理解了视觉世界的运作规律。于是他们自己动手,构建了一个全新的测试集,命名为VR-X。
VR-X从16个不同的数据来源精心筛选素材,这些来源横跨机器人操控、日常烹饪、手工艺制作、导航规划、棋盘游戏、视觉搜索等极为不同的领域,原始素材总量达到150万条。经过严格筛选后,最终整理成31万条用于初期训练的冷启动数据、3000条用于强化学习训练的数据,以及1800条专门用于测试评估的高质量样本。
VR-X的任务被分成两大类。第一大类叫"长期规划",考验的是AI能不能在较长时间内维持一个连贯的行动序列。举个具体例子:给AI看一张桌子上放着礼物盒和绳子的图片,然后问"如何在这个礼物上打一个结?请用4个步骤完成",AI需要直接生成4张图片,依次展示手部动作和绳子状态的变化,最终呈现一个真实合理的打结过程。这类任务还包括用给定食材制作烤鸡翅、把衬衫折叠整齐、机械臂抓取物品等,时间跨度可以长达几分钟。第二大类叫"通用推理",考验的是更基础的视觉认知能力,比如在复杂背景中找到指定物体(视觉搜索)、根据题目要求在迷宫图上画出正确路径(空间推理)、按顺序翻转骰子到指定面朝上(规则推理)、从图片中识别时钟并标注关键区域(视觉理解)等。
评分方面,VR-X采用了两套互补的指标。第一套叫"VLM评分",让一个强大的视觉语言模型(具体用的是参数规模达3970亿的Qwen3.5-397B)扮演评委,从任务完成度、步骤连贯性、视觉信息量、图像保真度四个维度打分,最终归一化到0到100分的区间。为了验证这个自动评分靠不靠谱,研究团队还专门请人工标注员对同样的内容打分,然后计算两者的斯皮尔曼相关系数(一种衡量两套打分结果一致性的统计指标),结果高达0.85,说明自动评分与人工判断的吻合程度相当高。
第二套指标叫"JEPA相似度",名字有点技术感,但道理很直接。研究人员发现,即便是很强的视觉语言模型,在评判视觉物理合理性时也会犯错——比如一段视频里绳子以不可能的方式弯折了,模型可能因为画面整体看起来还不错就给了高分。为了弥补这个漏洞,他们引入了V-JEPA这种专门用于捕捉时空动态特征的编码器,把生成的视频序列和真实参考序列都映射到一个"物理动态特征空间"里,计算两者分布之间的距离(用最大均值差异这个技术指标来衡量)。距离越小,说明AI生成的序列在物理动态规律上越接近真实世界。这个指标主要用于评估长期规划类任务,因为那里才涉及真实的物理动态变化。
三、主角登场:UniVR的架构设计和训练思路
UniVR的核心架构建立在一个叫Emu3.5的基础模型上。Emu3.5是一种能同时处理文字和图像的统一生成模型,它的特别之处在于用一种叫VQ-VAE的技术把图像和文字统一编码成同一套"词汇"——就像把两种不同语言都翻译成同一种中间语言,让模型可以用同样的方式处理文字token(文字的基本单元)和图像token(图像的基本单元)。这使得UniVR可以把视觉推理过程和文字理解放在同一个框架里,也方便后续研究视觉推理能力是否能反过来促进文字理解能力的提升。
整个训练过程分成两个阶段,可以类比成先上学后实战。
第一阶段叫"冷启动",相当于基础教育阶段。研究团队把31万条涵盖各种视觉任务的高质量样本喂给模型,让它先学会"基本功"——给定一张查询图片和一段文字说明,模型要能生成一系列视觉上连贯的步骤图片。数据处理过程本身就颇为讲究,研究团队用PySceneDetect工具对原始视频以每秒0.27帧的频率进行场景感知采样(这个频率比随机采样能保留更丰富的信息),再用SigLIP2做去重处理,然后用视觉语言模型过滤掉人脸特写、模糊帧、空白画面等低质量内容。接着,用Qwen3.5-397B为每段视频自动生成推理导向的问题和对应的文字步骤描述,再由模型根据这些描述选出最相关的关键帧。最后还有一轮严格的质量过滤,剔除图文不匹配、问题太简单、视觉质量差的样本。整个流程筛掉了将近80%的候选素材,确保留下来的都是最有学习价值的内容。每张图片被缩放到512像素短边,编码成1000到1500个token,最长序列控制在15000个token以内。
第二阶段叫"强化学习",相当于实战磨砺阶段。在冷启动的基础上,研究团队观察到一个问题:用监督学习(即直接模仿正确答案)训练出来的模型,在面对VR-X中那些差异巨大的异构任务时,很难同时在所有任务上都表现出色。比如,2D谜题和长期人体动作规划在时间尺度、领域知识和视觉外观上都天差地别,让模型同时精通这两类任务,监督学习的方式力不从心。于是,他们引入了强化学习——不告诉模型"正确答案是什么",而是让模型自己探索、自己尝试,根据尝试结果的好坏来调整策略。
四、核心创新:VR-GRPO如何教会AI"反省自己的每一步"
UniVR最重要的技术创新是一套叫VR-GRPO的强化学习方法,全称是视觉推理GRPO(GRPO是一种高效的强化学习算法,最初因DeepSeek-R1的成功而广受关注)。VR-GRPO的精髓在于它设计了一套专门针对视觉推理的奖励机制。
奖励,可以理解为给模型的"打分"——模型做得好就给高分,做得差就给低分,模型会慢慢学着往高分方向靠拢。现有的奖励机制大多关注两类事情:一是生成的图像好不好看(美学质量),二是生成结果和文字描述匹不匹配(跨模态对齐)。但这两类奖励对于复杂的视觉推理任务来说远远不够,就像只用"字迹工整"和"卷面整洁"来评判作文,完全忽视了逻辑是否通顺、论据是否充分。
VR-GRPO的奖励体系由两部分组成。第一部分是格式奖励,负责确保生成的图像序列满足基本结构要求,比如所有图片分辨率一致、图片数量符合任务指令中规定的步骤数等,这相当于作文的基本格式要求。
第二部分才是重头戏,叫视觉推理奖励。它又细分为全局奖励和步骤焦点奖励两个层次。
全局奖励的原理比较直接:让一个强大的视觉语言模型(这里用的是Qwen3-VL-30B,一个300亿参数的视觉语言模型)扮演评委,看着模型生成的整个序列和参考答案,评判任务完成情况和视觉质量,打出一个总体分数。研究团队最初只用这个全局奖励来训练,很快发现了严重问题——模型学会了"耍赖"。
具体来说,当一个任务需要展示"把衣服挂到衣架上"的6步完整过程时,模型可能生成的序列里,前两步和最后一步看起来都很正确,但中间某一步衣架穿过了衣服的布料(这在现实中根本不可能发生),或者某一帧画面中两只手的位置突然从左边跳到右边,完全不连贯。这类错误发生在序列中间的某一两帧里,持续时间很短,全局评委看了整个序列之后,被整体上还不错的视觉效果蒙蔽,给出了很高的分数,却完全没有发现这些局部的物理错误和逻辑断裂。这就是所谓的"奖励欺骗"——模型学会了用好的整体外观来掩盖中间步骤的错误,而不是真正学会了正确的推理过程。
为了解决这个问题,研究团队设计了步骤焦点奖励。它的工作原理有点像一个精明的监考老师,不只看最终答案对不对,还会专门盯着那些最容易出错的步骤重点检查。
具体操作是这样的:在训练时,模型会对同一个任务生成多个不同的"解答"(比如8个不同版本的图像序列)。然后,用CLIP图像编码器(一种能把图像映射成数字向量的工具)提取每个序列在每个时间步的特征,计算在同一时间步上不同版本序列之间的"方差"——方差越大,说明不同版本在这个时间点的差异越大,也就意味着模型在这个时间点最"不确定",最容易出错。找到方差最大的时间点后,提取其前后各几帧(由参数W控制窗口大小),形成一个重点关注的子片段。然后把两个版本序列的这个关键子片段分别交给视觉语言模型,让它做配对比较——"A和B哪个更符合物理规律、哪个更接近目标状态",而不是直接打分。这种配对比较的方式能有效减少视觉语言模型在直接打分时可能产生的偏差。
最终,全局奖励和步骤焦点奖励通过一个专门设计的公式组合起来:总奖励等于全局奖励减去一个系数乘以全局奖励与步骤焦点奖励之差的绝对值。这个公式的精妙之处在于,它强迫全局分数和步骤分数保持一致——如果模型只在最终结果上表现好,但中间步骤漏洞百出,那么两个分数之间的差距就会很大,总奖励就会被大幅惩罚。这样一来,模型要想得高分,不仅要把最终画面画对,还必须确保每一个中间步骤都合理可信。
训练过程中,从原始的31万条样本里用冷启动后的模型筛选出大约3000条"较难"的样本作为强化学习的训练集,其中约2000条是需要6到10个推理步骤的长期规划任务,约1000条是通用推理任务,以保持任务多样性。整个强化学习过程在32块GPU上进行全参数训练,评委模型(Qwen3-VL-30B)部署在额外的8块GPU上,总共训练250步。
五、实验结果:数字背后的故事
在VR-X测试基准上,研究团队系统比较了UniVR与当前业界最强系统的表现,结果相当能说明问题。
被测试的系统分两大阵营。第一阵营是"文字专家+图像生成"的组合流水线,代表了目前商业AI的最高水平,包括谷歌的Gemini 3 Pro(配合Nano Banana 2图像生成模型)、OpenAI的GPT-5(配合GPT-image 1.5)、阿里的Qwen3.5-397B(配合Qwen-image-edit),以及Gemini 2.5 Pro(配合Nano Banana 1)。这些系统的工作模式都是:大语言模型先生成文字步骤,然后图像生成模型按文字指令一步步生成图片。
第二阵营是统一生成模型,包括Janus-pro、Show-o2、ILLUME+、OneCAT、STAR、OmniGen2、Bagel,以及作为UniVR基础的Emu3.5。
在综合得分(满分100分)方面,谷歌Gemini 3 Pro加上Nano Banana 2的组合表现最好,达到66.1分,GPT-5组合紧随其后得到63.5分。而在统一生成模型阵营里,作为UniVR出发点的Emu3.5基础模型只得到39.8分,其他统一模型更是普遍在25分以下徘徊,其中表现最差的Janus-pro只有15.3分。
经过UniVR的训练流程,同样基于Emu3.5的模型综合得分提升到了58.2分,相比基础版Emu3.5提升了整整18.4分。在具体任务上,提升最显著的是机器人操控类任务,得分从42.8分跳升到68.0分,提升了25.2分;视觉引导类任务从38.6分提升到59.5分,提升20.9分。
更值得关注的是物理真实度指标——JEPA相似度(这个指标越低越好,代表生成内容越接近真实物理世界)。Emu3.5基础模型的JEPA分数是33.62,而UniVR降到了13.01,降低了20.61分,表现接近Gemini 3 Pro组合(该组合的JEPA分数为11.07)。相比之下,其他统一生成模型的JEPA分数普遍在47到77之间,与真实物理世界的差距是UniVR的约2到4.5倍,说明它们生成的内容在物理合理性上存在严重问题。
参数规模只有340亿的UniVR,在多个关键指标上超过了Gemini 2.5 Pro的组合(综合分60.8分),这一点尤为值得关注——毕竟背后的研究逻辑完全不同,UniVR靠的是直接在视觉空间里学习推理,而不是靠堆砌语言能力。
六、意外惊喜:视觉推理能力反过来提升了文字理解
研究过程中有一个出乎意料的发现,让研究团队感到振奋。他们测试了UniVR在标准多模态理解基准上的表现(这些基准的任务形式是传统的问答,而不是生成视觉序列),发现强化了视觉推理能力的UniVR,在文字理解和多模态问答上也有明显提升。
具体数据是:在MMMU(一个考察广泛学科知识的多模态理解基准)上,UniVR得分从Emu3.5基础版的0.292提升到0.337,提高了0.045;在MME知觉评分上从781.1提升到799.3,在MME认知评分上从324.6提升到338.5;在MathVista(数学视觉推理基准)上从41.7提升到44.0;在MM-Vet(综合能力评估基准)上从28.0提升到35.6,提升幅度达到27%。
更有意思的对比是:研究团队还单独测试了"只训练文字推理链"的效果,也就是用同样的数据但只给文字标注进行训练,这种传统方式的提升几乎可以忽略不计。这说明视觉推理能力的强化与文字理解能力之间存在某种相互促进的关系,视觉空间的丰富训练似乎帮助模型建立了更扎实的世界知识基础,从而反过来支撑了语言层面的理解。
七、消融实验:每个设计决策的必要性
研究团队还做了一系列"拆零件"测试,也就是一个一个地去掉某个设计组件,看看去掉它之后性能会怎么变化,以此验证每个创新设计是否真的有效。
关于VR-GRPO的各个组件,测试结果显示:只用全局奖励的情况下,通用推理得分确实提升了3.6%,但长期规划得分却下降了,JEPA分数也变差了——这正是奖励欺骗的典型表现。只用步骤焦点奖励的情况下,三个指标都有正向提升,但提升幅度有限。把两者结合起来,产生了协同效应,各项指标进一步提升。再加上配对比较协议(而不是直接让模型打绝对分数),奖励的稳定性进一步增强,最终结果也更好。
关于与其他奖励机制的兼容性,测试发现:美学质量奖励HPSv3和视觉文字对齐奖励CLIP对复杂视觉推理任务帮助非常有限,HPSv3的效果甚至可以忽略不计。但VR-GRPO可以和这些奖励机制同时使用,彼此不冲突,而且加入VR-GRPO之后整体效果远超单独使用其他奖励机制的情况。
关于多任务联合训练,在没有强化学习的冷启动阶段,把长期规划和通用推理任务放在一起训练,效果反而不如分别训练——说明这两类任务知识差异太大,简单的监督学习难以同时兼顾。引入VR-GRPO之后,联合训练开始真正奏效,两类任务的得分都超过了单独训练的结果,说明VR-GRPO帮助模型自主找到了处理不同类型任务的最优策略,实现了真正的多任务泛化。
关于时间跨度的影响,研究团队把测试样本按任务持续时间分成4组(10秒以内、10到30秒、30到60秒、60秒以上),分别比较了Emu3.5基础版、冷启动版和UniVR的得分。结果显示,UniVR在30秒以上的长任务上提升最为显著,60秒以上的超长任务提升了23.9分,而10秒以内的短任务只提升了16.9分。这与步骤焦点奖励的设计思路完全吻合——它专门针对中间步骤的错误进行纠正,时间越长、步骤越多,这种纠正的累积效果就越明显。
关于跨基准泛化能力,研究团队还在三个完全没有参与训练的外部测试集上评估了UniVR:WorldArena(评估具身智能场景下的感知和功能能力)、Uni-MMMU(大规模多学科多模态理解基准)和RBench(视频生成模型的具身推理评估)。面对训练数据中从未见过的机器人操控场景、摄像机视角和数理推理问题,UniVR依然比Emu3.5基础版提升了9.2到25.7分不等,其中Uni-MMMU的提升最为突出。更重要的是,UniVR的提升幅度显著超过了只做冷启动监督学习的模型,再次证明VR-GRPO培养出的视觉推理能力具有真正的泛化性,而不是对训练数据的死记硬背。
八、局限性与未来:这还只是开始
研究团队在论文中坦诚地列出了UniVR的几个主要局限,这种透明度对于真正推动领域进步很有价值。
在计算资源方面,340亿参数规模的模型加上需要处理长达数万个token的视觉序列,训练成本相当可观——需要32块高性能GPU同时工作,加上额外的评委模型所需的8块GPU,总计40块GPU才能支撑完整的训练流程。这对于大多数研究机构来说门槛不低。
在奖励机制方面,步骤焦点奖励虽然比纯全局奖励更精准,但依然依赖通用目的的视觉语言模型来判断物理合理性。而这些视觉语言模型的世界知识主要来自文字训练,对细粒度的物理动态变化(比如液体流动的方式、织物在空中的形变规律)判断能力有限。要想进一步提升,可能需要构建专门针对视觉物理世界进行原生训练的奖励系统。
在多模态协同方面,虽然实验证明视觉推理能力和文字理解能力之间存在相互促进的关系,但如何在视觉推理、文字推理和语音理解之间实现真正协同、相互增强的训练,目前还没有清晰的答案,有待未来研究探索。
归根结底,UniVR这项研究的意义不仅在于它在各项指标上取得的具体数字,更在于它证明了一件此前没有人系统验证过的事情:AI完全有可能直接从原始视觉数据中学会复杂的推理和规划能力,不需要把每一段视频都配上详细的文字说明,不需要为每种任务单独设计规则,只需要一套恰当的奖励机制来引导学习方向。从这个意义上说,UniVR打开了一扇窗,让人看到了一种更接近人类视觉认知方式的AI学习路径的可能性。
未来,如果这个方向能继续发展,或许有一天AI能够直接观看一段从未见过的手工艺视频,就学会如何在真实世界中复现那个操作——就像一个天资聪颖的学徒,只需要看师傅做一遍,就能大致领会其中的要领。那将是一个非常不同的AI能力起点。
感兴趣的读者可以通过arXiv:2607.12800查阅完整论文,或者访问项目主页UniVR.github.io获取代码、数据和模型资源,研究团队已将这些内容全部开源。
Q&A
Q1:UniVR和现有AI在视觉任务上的本质区别是什么?
A:现有AI(比如GPT-5、Gemini)处理视觉任务时,会先把图像信息"翻译"成文字描述,在文字空间里做推理,再把文字结果转换回图像。UniVR则直接在视觉空间里完成推理和规划,不需要文字作为中介,更接近人类用眼睛直接"脑补"后续画面的方式。这使得它在需要精确捕捉物理动态(比如绳子打结、布料折叠)的任务上有结构性优势。
Q2:VR-GRPO里的步骤焦点奖励为什么能防止AI"耍赖"?
A:只用全局奖励时,AI会学着把整体结果做得好看,但忽略中间步骤的错误——就像交一篇开头结尾写得漂亮但中间逻辑混乱的作文。步骤焦点奖励专门找出AI最容易出错的中间步骤重点评判,并要求整体分数和步骤分数保持一致——两者差距越大,总分惩罚越多。这迫使AI真正把每一步都做对,而不只是把开头和结尾做好看。
Q3:VR-X基准测试和现有视频生成评测标准有什么不同?
A:现有评测主要衡量生成视频的画面质量和与文字描述的匹配程度。VR-X评测的核心是"视觉推理是否正确"——任务步骤逻辑是否连贯、中间过程是否符合物理规律、最终结果是否真正完成了任务。除了视觉语言模型打分外,还引入了V-JEPA编码器来评估生成序列与真实物理世界在动态特征上的接近程度,专门捕捉那些画面看起来还不错但物理上根本不可能发生的错误。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.