来源:市场资讯
(来源:科技行者)
![]()
这项由浙江大学、深圳卓语科技、北京航空航天大学、电子科技大学、南洋理工大学及香港中文大学(深圳)联合完成的研究,以预印本形式发布于2026年7月30日,论文编号为arXiv:2607.27703。有兴趣深入了解的读者可以通过该编号在arXiv学术平台查询完整论文。
**一、先从一个让人头疼的问题说起**
假设你是一个需要独立完成工作的机器人助手。有人指着一堆玩具熊问你:"哪只是离我最远的那只?"这个问题听起来简单,但要正确回答,你需要同时做好几件事:先把所有熊认出来并圈出它们的位置,接着测量每只熊距离镜头的实际距离,最后根据测量结果找出最远的那只,并精确标出它在画面中的坐标。
对于人类来说,这些判断几乎是一瞬间完成的本能反应。但对于目前的AI系统来说,这就像是让一个擅长做数学题的学生去打篮球——能力完全对不上号。
现有的AI视觉系统存在一个根本性的矛盾:那些通用的大型视觉语言模型(可以把它们理解为"博学多才的通才助手")确实懂得理解指令、拆解任务、组织多步骤的推理过程,但一旦任务需要精确判断某个物体在画面中的具体位置、物体的轮廓边界、场景的深度距离或者物体的朝向姿态,这些通才助手就开始频繁出错。另一方面,那些专门负责精确感知的专业视觉模型(可以把它们比作"精密测量仪器")倒是能准确完成各自的单项工作,但它们完全不懂任务目标,不知道什么时候该用自己的能力,也无法把自己的测量结果传递给最终决策过程。
通才助手有脑子没眼力,精密仪器有眼力没脑子——这就是这篇论文要解决的核心矛盾。
研究团队给出的解决方案叫做**SpatialCLI**,一个让AI"先借眼看,再把视力学到自己眼里"的训练框架。这套框架的名字里藏着它的核心逻辑:Call(借用)、Learn(学习)、Internalize(内化)。更重要的是,研究团队还为此专门建立了一套全新的评测标准,叫做**SpatialCLI-Bench**,用516道需要综合运用多种空间感知能力才能回答的题目来考察模型的真实水平。
**二、通才与专才的能力鸿沟究竟有多深**
在动手解决问题之前,研究团队先做了一番诊断,把这个"通才有脑专才有眼"的矛盾摆在了明面上。
通用视觉语言模型在日常对话、常识推理、图文理解这类任务上表现出色,但当任务要求精确回答"这个东西的边缘轮廓在哪里""这个点距摄像头多少米""这个物体面朝哪个方向"时,它们的表现就变得不可靠了。这种不可靠不是随机的误差,而是系统性的盲区——通用模型在训练过程中并没有接受过这类精细感知的专项训练,就像一个没有练过近视矫正的人,再聪明也看不清楚细节。
专业视觉模型则是另一个极端。研究中用到的几个专业工具包括:SAM 3(负责分割物体轮廓,像是给图中每个物体精确画边界)、Depth Anything 3(负责测量场景深度,能估算出画面中每个点距摄像头的实际距离,单位是米)、Orient Anything V2(负责判断物体朝向)、VGGT(负责分析多张图片之间的摄像机移动方向)。这些模型各司其职,每一个在自己的专项任务上都比通用模型准确得多,但它们完全不能告诉你"在当前这道题里,我的能力应该被用在什么地方,我的结果应该怎么被解读"。
已有的一些尝试,比如SpaceTools和AlloSpatial,虽然也试图把工具引入推理流程,但研究团队在实验中发现,这些方案在较弱的基础模型上效果有限,原因之一在于它们没有系统地训练模型如何把工具输出转化为内在能力。
**三、SpatialCLI的三步走:从"借眼"到"长眼"**
研究团队设计的SpatialCLI框架就像一套精心设计的职业培训体系,分为三个递进的阶段。
**第一阶段:Call(借用),给AI配上一副外置望远镜**
在最基础的阶段,通用视觉语言模型并不需要自己具备精准感知能力,它只需要知道"当我需要测量距离时,可以呼叫深度工具;当我需要确认物体轮廓时,可以呼叫分割工具"。这套机制的设计思路来源于ReAct框架(一种让语言模型在推理过程中可以调用外部工具的标准方法)。
具体来说,模型在每一步推理中要么给出最终答案,要么发出一个工具调用请求。工具调用的格式是统一的XML包裹的JSON结构,只有严格符合这个格式的输出才会被识别为工具调用,其余所有输出都被视为最终回答。工具执行完毕后,结果会被追加到对话历史中,供模型继续推理使用。
为了让模型合理使用工具而不乱调用,系统还引入了"工具调用预算"机制——每次交互最多允许调用10次工具,每次工具执行后系统都会告知模型"还剩几次机会",当预算耗尽时,系统会强制要求模型直接给出答案,不允许再继续调用工具。研究团队还发现,如果每轮对话不保留模型的推理内容,模型会在后续轮次中重复之前已经完成的推理,浪费计算资源,因此他们选择在整个交互过程中完整保留模型的所有推理历史。
四个空间工具各有明确的职责分工。定位工具(Locate)背后融合了Locate Anything和Grounding DINO两个检测器的结果,当两者对同一目标的检测框重叠度超过50%时,会按照2:1的权重合并成一个更精确的结果,最终返回物体的边界框坐标和中心点坐标。分割工具(Segment)使用SAM 3进行实例分割,返回每个实例的边界框、中心点以及多边形轮廓(每个连通区域最多16个顶点,要求轮廓光栅化后与原始掩码的交并比不低于0.97)。深度工具(Depth)使用Depth Anything 3的公制深度估计模型,在504像素分辨率下推理,返回查询点处的相机轴距离(单位:米,数值越小代表越近)。姿态工具(Pose)则分为两种模式:对于单张图中的物体朝向,使用Orient Anything V2按照360个方位角离散区间进行预测,并转换为前/后/左/右及组合方向描述;对于两张图之间的摄像机运动,使用VGGT联合估计每张图的外参矩阵,推导出摄像机的平移方向和旋转方向,并以+X右、+Y上、-Z前进的右手坐标系表示。
**第二阶段:Learn(学习),让AI真正掌握什么时候该用什么工具**
仅仅拥有工具还不够——模型需要学会什么时候调用工具、调用哪个工具、传入什么参数、以及如何把工具返回的结果用于后续判断。这一阶段分为冷启动监督微调和智能体强化学习两个步骤。
冷启动监督微调的逻辑是:先请一个"老手"(研究中使用的是Qwen3.5-397B-A17B,一个参数量更大的教师模型)去解决一批训练任务,把它调用工具的完整过程录制下来,过滤掉格式错误、工具执行失败或最终答案错误的样本,保留大约40%的高质量轨迹(约2000条),然后用这批轨迹训练较小的学生模型。训练时,工具返回的结果只作为上下文背景,不计入损失函数,模型需要学习的是自己生成的推理内容、工具调用指令以及最终答案。
冷启动完成后,进入强化学习阶段。这个阶段的核心思路是:让模型在真实的工具交互环境中不断尝试,根据最终答案的对错来调整策略。具体使用的算法是GRPO(一种基于组内相对奖励的策略梯度方法),每道题同时生成8条完整交互轨迹,每条轨迹按最终答案是否正确获得奖励(多选题答对得1分,答错得0分;对于需要预测点序列的任务,使用基于对称Chamfer距离的连续得分)。重要的是,损失函数的梯度只计算在模型生成的token上(推理内容、工具调用指令、最终答案),工具返回的内容不参与梯度计算。训练使用了改进的GRPO目标函数,采用非对称裁剪比例(低截断0.20,高截断0.28)和token级别的策略梯度归约,来自DAPO算法的优化技巧。
实验结果显示,冷启动对于强化学习的稳定性至关重要。没有冷启动直接做强化学习的模型,每条轨迹的工具调用次数会从3.36次膨胀到6.74次,说明模型不知道什么时候该停下来,而有了冷启动的模型工具调用次数稳定维持在2.56次左右。
**第三阶段:Internalize(内化),把外置望远镜的视力"移植"进模型自己的眼睛**
这是整个框架最有野心的部分。外置工具固然强大,但如果每次推理都需要调用外部服务,在实际部署中会带来延迟、依赖和成本问题。更重要的是,研究团队想探索一个根本性的问题:能否把专业工具提供的感知能力转移到模型的内部参数里,让模型在没有任何工具的情况下也能产生相似水平的感知判断?
这个过程分为两个步骤:渐进式证据轨迹语言化,以及双视角能力内化训练。
渐进式证据轨迹语言化的目的是把工具交互轨迹转化成模型可以学习的自然语言监督信号。原始轨迹包含大量重复的对话历史、机器格式的工具调用指令和异构的工具返回结果,直接用作训练数据效果很差。研究团队设计了两步处理流程:第一步是逐轮证据整合,对每一轮工具交互,都用一个"证据提取器"(实际是用Qwen3.5-397B-A17B来执行)把当前工具返回的结果和模型此前的视觉观察整合成一段自然语言的证据描述,要求完整保留工具返回的所有数值(边界框、深度值、方向等),不得省略或四舍五入,同时不能把规划、猜测或答案选项分析写进去当成已观察到的事实。第二步是全局轨迹语言化,把所有轮次的证据整合单元统一交给一个"全局语言化器",生成一段从感知观察到最终答案的完整推理链,去除冗余,理清因果,并且只能使用证据单元中已经出现的实体、属性和数值,不得凭空引入新信息。这两步都在知道正确答案的前提下进行,但证据整合步骤故意不告知正确答案,以防止模型根据答案逆向构造伪证据。
双视角能力内化训练则在同一个模型中同时训练两种能力:能力内化视角(不提供任何工具,让模型直接根据图像和问题生成那段感知推理链,然后给出答案)和工具使用视角(保留原始工具交互结构,按照工具调用的对话格式训练,工具返回的内容只作为上下文,不计入损失)。两种视角的损失函数加权求和,权重λ设为0.5。实验表明,当λ=0.5时,无工具表现(72.7%)和有工具表现(91.3%)都达到最优平衡;当λ过大(如1.5)时,模型会倾向于保留工具依赖而放弃内化,无工具表现骤降至62.9%。
**四、SpatialCLI-Bench:一把专门考察综合空间感知的尺子**
在制作这套工具的同时,研究团队还意识到现有的空间理解基准测试存在一个系统性缺陷:它们几乎都是单项考核,要么测定位要么测深度,从不考察模型能否在一道题里同时用上多种能力。这就像是用单项运动测试来评估一个篮球运动员——你可以知道他跑得多快、跳得多高,但无法知道他在实际比赛中能否把这些能力组合起来。
为此,研究团队建立了SpatialCLI-Bench,包含516道题目,每道题都有6个选项(其中只有1个正确),需要综合运用至少两种空间感知能力才能作答。题目覆盖三类能力的组合:定位与二维区域关系(G类)、公制深度(D类)、物体朝向或跨视角摄像机运动(P类)。514道题中有114道需要GD组合、113道需要GP组合、102道需要DP组合、187道需要GDP全部三种能力。
题目的来源涵盖8个视觉数据集,包括MindCube(195道,37.79%)、CA-1M(116道,22.48%)、HOPE(110道,21.32%)、OpenImages(29道,5.62%)以及LINEMOD、YCB-V、HANDAL和RefSpatial-Blender(合计共66道)。题目构建分四个阶段:先由Gemini 3.1 Pro对每张图或图对做实体盘点,接着由四个专业工具分别采集定位、分割、深度和姿态证据并过滤掉证据不完整或有歧义的候选,然后由Gemini 3.1 Pro基于已验证的证据生成题目、正确答案、五个干扰项以及私有的证据溯源说明,最后由两名具有具身智能研究背景的研究生在不知道Gemini生成答案的前提下独立作答,只有双方答案与生成答案完全一致的题目才被保留。原始生成720道候选题目,最终保留516道,保留率71.67%。
每道题还配有一个私有的"神谕工具计划",记录了用至多5步工具调用解决这道题的最优方案,平均每道题需要3.81步工具调用。在所有神谕计划中,分割工具被调用862次,深度工具471次,姿态工具404次,定位工具227次。
**五、实验结果:数字背后的故事**
研究团队用三个不同规模的基础模型(Qwen3-VL-8B-Instruct、Qwen3.6-35B-A3B、Qwen3.6-27B)分别训练了SpatialCLI系列模型,并在五个评测集上进行了全面测试。
最直观的对比来自最小的模型版本。Qwen3-VL-8B-Instruct在MindCube基准上的原始得分只有29.3%,装上SpatialCLI工具组合后提升到47.2%,而经过完整三阶段训练后的SpatialCLI-8B在无工具状态下达到了73.8%,加上工具后更是达到了84.6%。这意味着,一个8B参数的小模型,经过这套训练体系后,在无工具状态下的表现已经超过了GPT-5.6 Sol(OpenAI的前沿闭源模型)使用SpatialCLI工具组合时的72.1%。这个对比颇能说明问题:能力内化之后,一个参数量小得多的模型可以在不依赖任何外部工具的情况下超越顶级大模型加工具的组合。
在SpatialCLI-Bench这个专项综合感知基准上,SpatialCLI-8B有工具时达到91.3%,无工具时达到72.7%。而GPT-5.6 Sol在这个基准上的得分只有48.8%,加上SpatialCLI工具组合后提升到72.9%——仍然低于训练后的SpatialCLI-8B无工具版本。这个结果揭示了一个值得关注的现象:即使是目前最强大的通用模型,在需要综合多种空间感知能力的任务上依然存在显著短板。
与同类工具增强方案的对比同样明显。在控制基础模型为Qwen3-VL-8B-Instruct的情况下,SpaceTools工具组合在SpatialCLI-Bench上只能达到39.3%,AlloSpatial工具组合达到43.2%,而SpatialCLI工具组合达到66.5%。这表明工具的接口设计和工具使用策略的训练质量对最终效果有决定性影响。
在工具返回格式的消融实验中,研究团队比较了三种方案:只返回带红色边框的可视化图片(Visual Only)、同时返回结构化坐标和可视化图片(Structured + Visual)、只返回结构化坐标和多边形(Structured Only,也就是最终采用的方案)。结果显示,纯可视化返回在SpatialCLI-Bench上只有45.9分,加入结构化坐标后跃升至66.0分,而去掉可视化只保留结构化输出反而略升至66.5分。这个结果说明,精确的数字坐标才是工具增益的主要来源,而把相同信息重复渲染成图片并不带来额外收益,还会增加视觉上下文的噪声。
在能力内化的数据扩展实验中,研究团队记录了随着内化训练数据量的增加,无工具表现从40.1%稳步升至74.0%,而四种能力的综合内化指数(CII)从45.6升至61.6,两条曲线几乎同步上升,证明性能提升来自真实的能力迁移而非答案记忆。
**六、如何量化"把工具能力学进肚子里"**
为了给能力内化提供一个可测量的指标,研究团队设计了一个叫做"能力内化指数"(CII)的评测协议。这个指标的核心思路是:让模型在不使用任何工具的情况下,尝试直接输出原本由专业工具才能产生的结构化结果,然后与专业工具的实际输出进行相似度比较。
具体来说,评测集包含1000道题,每种能力各200道:定位(输出边界框)、分割(输出多边形轮廓)、深度(输出公制距离)、物体朝向(输出方向描述)、摄像机运动(输出平移和旋转方向)。对于定位能力,使用匈牙利算法找到预测框和参考框的最优匹配,计算匹配对的IoU均值(未匹配的框对应0分)。对于分割能力,先将多边形光栅化后再做IoU计算和匈牙利匹配。对于深度能力,计算预测深度与参考深度的绝对相对误差(AbsRel),然后用e的负AbsRel次方转化为0到1之间的相似度(误差越小,相似度越高)。对于姿态能力中的物体朝向,将8个方向(前、后、左、右及对角线方向)映射到圆周角度,计算预测与参考之间的圆周角距离,用cos值转化为0到1的相似度;对于摄像机运动,分别评估平移方向(通过有符号轴向量求方向余弦相似度)和旋转主轴(同样通过方向余弦相似度),取平均后作为最终得分。四种能力各自的CII取宏平均得到综合CII。
在规模扩展实验中,有一个有趣的发现:工具使用性能在三个模型规模(8B、35B-A3B、27B)之间的差异非常小,最多相差1分,但无工具状态下的内化表现则随模型规模明显提升,27B和35B-A3B模型在所有四种能力的CII上都显著高于8B模型。这说明工具调用本质上是一个相对紧凑的"调用与整合"策略,一旦这个策略学会了,外部专业工具就承担了大部分感知负担,不同规模的模型之间差异就被抹平了;而能力内化则要求模型把多种专业感知能力编码进自己的参数,这对模型容量的要求更高,因此规模越大收益越明显。
**七、那些值得关注的细节**
工具调用行为的对比实验揭示了一个有趣的现象。在各种内化训练方案的对比中,研究团队发现,只做能力内化训练(Internalization View Only)的模型,在使用工具推理时会出现严重的失控行为:平均每条轨迹调用工具20.7次,而其中有工具调用的样本,每条平均调用51.35次。这种"疯狂调用"说明模型的工具使用策略被能力内化训练破坏了,陷入了无法停下来的循环。只做工具使用训练(Tool-Use View Only)的模型则能保持稳定的1.28次平均调用次数,81%的样本至少调用一次工具。双视角同时训练的完整方案(Full Dual-View)保持了与Tool-Use View Only几乎完全一致的工具调用行为(平均1.27次,81.5%样本有调用),同时在无工具表现上达到了72.7%的最高分。这验证了双视角训练的核心价值:两种能力确实可以在同一个模型中共存而不相互干扰。
从两个具体案例来看,工具增强的价值也更加直观。在第一个案例中,模型需要判断两个垃圾桶哪个更近,以及摄像机的旋转方向。无工具版本根据垃圾桶在画面中的相对大小和位置做出了视觉推断,认为米色桶更近,但实际上深度工具测量结果显示米色桶距摄像头0.928米,蓝色桶只有0.776米——蓝色桶反而更近。工具增强版本先定位两个桶的中心点,查询摄像机运动方向,再用深度工具精确测量,最终用数字证据推翻了初始的视觉判断,给出了正确答案。在第三个案例中,已经完成能力内化的SpatialCLI-8B在无工具状态下输出了深度估算值0.362米和0.615米,与工具实际测量值0.351米和0.637米高度接近,两种模式都给出了相同的正确答案,定性地展示了内化的效果。
Q&A
Q1:SpatialCLI框架的三个阶段分别做什么?
A:SpatialCLI框架分三个阶段运作。第一阶段Call是"借用",把专业视觉工具(定位、分割、深度、姿态)接入通用视觉语言模型,让模型可以在推理过程中调用这些工具;第二阶段Learn是"学习",先用教师模型的成功轨迹做冷启动微调,再通过强化学习让模型学会何时调用哪个工具;第三阶段Internalize是"内化",把成功的工具使用轨迹转化为自然语言监督信号,训练模型在不使用任何工具的情况下也能产生类似的感知推理能力。
Q2:SpatialCLI-Bench和其他空间理解基准测试有什么不同?
A:SpatialCLI-Bench的核心区别在于它专门测试"综合感知",也就是需要同时用上多种空间能力才能回答的题目。现有的大多数基准测试都是单项考核,要么只测定位要么只测深度。SpatialCLI-Bench的516道六选一题目,每道都至少需要两种能力的组合(定位与区域关系、公制深度、物体朝向或摄像机运动),并且每道题都经过专业视觉工具验证和两位人类专家独立审核,保证答案的客观性。
Q3:能力内化指数(CII)是怎么测的?
A:CII的测法是:让模型在不使用任何工具的情况下,直接输出原本需要专业工具才能产生的结构化结果,比如物体的边界框坐标、轮廓多边形、深度距离值或方向描述,然后把模型的输出与专业工具的实际输出进行相似度比较。不同类型的结果有不同的相似度计算方式,比如边界框用IoU、深度用绝对相对误差的指数转化、方向用圆周角余弦相似度。四种能力各自的CII取宏平均得到综合CII,数值越高说明模型把工具能力"学进自己肚子里"的程度越高。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.