网易首页 > 网易号 > 正文 申请入驻

行动即推理:南洋理工大学等提出S-Agent,空间智能迈入Agent时代

0
分享至



南洋理工大学S-Lab联合Ropedia提出S-Agent,把空间理解从一次性回答改写为一条可执行的行动链:VLM 负责读懂问题、规划下一步,DA3 等专用模型负责深度、位姿和 3D 对齐,空间专家再把几何输出转化为可用证据。论文结果显示,S-Agent 在 zero-shot 设置下取得 MMSI-Bench 46.4%、ViewSpatial-Bench 60.0% 的成绩;通过 S-300K 轨迹蒸馏,8B 模型进一步在 MMSI / ViewSpatial 上达到 41.6 / 46.8。



  • 论文标题:S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
  • 项目页:https://ropedia.github.io/S-Agent
  • 论文:https://arxiv.org/abs/2606.20515
  • 演示视频:https://youtu.be/f89D0ZCJWKo



视频链接:https://mp.weixin.qq.com/s/3P_oyOJwRMkq_RaXbl7bUA

“站在耳机旁,背对入口门,相机在你的哪个方向?”

开场视频给出的,是一个典型的动态空间推理问题。对人类来说,它像一次短暂的心理旋转;对视觉语言模型来说,它要求模型同时完成实体定位、跨帧对齐、三维理解和自我中心坐标转换。模型拿到的不是一张线索完整的全景图,而是一段视频中抽取的 64 帧:耳机、入口门和相机分散在不同观察里,“左、右、前、后” 还必须以人的站位与朝向重新定义。

图 1 展开了这条行动链。S-Agent 没有直接猜答案,而是先定位三个实体,再把离散的 2D 线索提升到共享 3D 场景,随后以耳机为原点、以 “背对入口门” 为朝向建立自我中心坐标系,最终判断相机位于右后方,提交 D(back-right)。整条轨迹包含 3 轮规划与 6 次工具调用,每一步行动本身就是推理的一部分。

这段不到一分钟的演示,浓缩了 S-Agent 的核心主张:空间智能不应只是 “看完视频后给出一个答案”,而应进入 Agent 式行动循环 —— 持续追问 “下一步该看哪里、测什么、验证什么”,并把每一次行动得到的证据累积成可追踪的世界状态。



视频链接:https://mp.weixin.qq.com/s/3P_oyOJwRMkq_RaXbl7bUA

图 1|案例视频中的完整行动链:定位实体、3D 对齐、建立自我中心坐标系,再解析相机象限。

空间智能迈入 Agent 时代:

让 VLM 理解任务,让专用模型处理几何

S-Agent 的切入点并不是否定 VLM,而是重新安排 VLM 在空间系统中的位置。VLM 的长处是理解:它能读懂问题意图,识别场景中的实体和关系,并把自然语言指令转化为可执行的判断目标。但在真实三维空间里,仅有语义理解还不够。深度估计、相机位姿、三维对齐、物体尺度与朝向,本质上更接近几何感知与空间计算,往往不是通用 VLM 最擅长的部分。

因此,S-Agent 的最初想法是:不要让 VLM 在一个模型里硬扛所有事情。对于 “图中有什么、问题在问什么、下一步该验证什么”,VLM 很强;但对于 “这个点到底有多远、相机如何运动、两个视角如何对齐”,DA3 等专用深度 / 三维模型通常更可靠。空间智能的关键,不是让 VLM 变成万能几何模型,而是让它学会把合适的问题交给合适的工具。

在这个基础上,S-Agent 把空间推理重新表述为时空证据累积(spatio-temporal evidence accumulation):VLM 不必一次性在参数内部完成识别、几何恢复、坐标变换和关系判断,而是作为 Agent 围绕当前问题发起一连串行动,调用 2D 感知、3D 几何和空间专家模型逐步补齐证据,并把已经获得的场景状态保留下来。

从回答器到行动规划器:

框架图里的三层分工

图 2 对应的是 S-Agent 的系统结构。VLM 在这里不再是被动回答器,而是语义规划器:每一步,它都会查看问题、原始观察、当前场景记忆和此前行动历史,再决定下一步需要哪类证据、应该调用哪个工具,以及现有证据是否已经足够。

工具体系按空间理解的层次被组织为三层。Level 1 负责 2D 视觉证据获取,包括从长视频或多视图输入中挑选关键帧、定位问题涉及的实体,以及借助开放词汇检测补齐遗漏目标;Level 2 把这些局部线索提升到三维空间,通过度量深度、相机位姿和鸟瞰图/新视角,把分散观察对齐到共享坐标系;Level 3 再由计数、测量、相对位置、视觉朝向和物体视角等空间专家,把密集且可能带噪声的几何输出转化为规划器可以直接使用的高层空间事实。

这种分工的关键,不只是 “给 VLM 加几个工具”。S-Agent 把语义决策、几何证据与状态维护拆成彼此可协作的行动模块:模型负责提出下一步行动,工具负责返回可验证的证据,记忆负责让证据在后续行动中继续生效。

论文中的消融实验也说明,进入 Agent 时代并不等于把所有 3D 输出原样塞给模型。原始深度、相机位姿和点云往往包含密集数值与噪声,规划器未必能直接读懂;真正拉开差距的是 Level 3 空间专家把这些几何输出过滤成任务相关的测量、相对位置和方向判断,再由双记忆把它们接入后续行动。也就是说,S-Agent 的关键不是 “工具更多”,而是 “每一步行动都能产生可用证据”。



图 2|S-Agent 框架示意:语义规划器、三层空间工具与双记忆协同工作。

结果:zero-shot 领先,

蒸馏后 8B 模型继续逼近前沿模型

论文首先验证了 training-free 的使用方式:无需对底座模型进行空间微调,只要把 S-Agent 的行动规划、空间工具与记忆机制接入现有 VLM,就能在多视图和视频空间推理任务上获得明显提升。论文表 1 展示了 MMSI-Bench 的 zero-shot 结果,S-Agent 在平均分上达到 46.4%,高于 Gemini 3 Pro 的 45.2% 和 GPT-5.4 的 41.9%。



论文表 1|MMSI-Bench zero-shot 结果表,截图自论文正文。

更重要的是,提升并不只体现在平均分上。相较所用 InternVL3.5-8B 底座,S-Agent 在 MMSI-Bench 上提升 17.4 个百分点,其中相机运动子任务提升 31.1 个百分点。在 ViewSpatial-Bench 上,S-Agent 达到 60.0%,人物视角相对方向(P-RD)得分为 81.1%;在 ReVSI 上,其平均成绩为 58.8%。

图 3 进一步把 zero-shot 和 SFT 两条结果线并排呈现。更值得关注的是蒸馏后的 S-Agent-8B:研究团队用约 29.2 万条 S-Agent 轨迹对 Qwen3-VL-8B 进行监督微调,模型在 MMSI-Bench 上从 31.1% 提升到 41.6%,在 ViewSpatial-Bench 上从 42.2% 提升到 46.8%。对照 GPT-5.4 的 41.9% 和 45.6%,这个 8B 模型在前一项几乎持平,在后一项高出 1.2 个百分点。

论文表 4 则给出蒸馏结果的完整对照:S-Agent-8B 同时超过 Qwen3-VL-8B-Instruct 和使用同一 8B planner 的 training-free S-Agent。这说明,紧凑模型未必需要把全部空间知识 “压进参数”;当它学会何时行动、如何解释工具结果,以及怎样跨步骤整合证据时,系统级能力可以显著超越底座模型本身。



图 3|论文项目视频中的性能对比页。S-Agent 在 zero-shot 与 SFT 设置下均获得显著提升。



论文表 4|S-Agent-8B 在 MMSI、ViewSpatial 与 ReVSI 上的蒸馏结果,截图自论文正文。

S-300K:把强 Agent 的行动过程,

变成小模型的课程

性能提升背后,是 S-300K 这套行动数据。S-Agent 不只是一个推理框架,也是一台行动轨迹数据生成器。研究团队使用强模型驱动的 S-Agent 生成空间推理轨迹,过滤掉执行失败或答案不正确的样本,并将有效过程整理为 S-300K。最终用于监督微调的样本约为 29.2 万条。

与只提供 “问题 — 答案” 的传统指令数据不同,S-300K 把监督信号拆成多种粒度:完整轨迹教模型如何从问题走到结论;轮次级样本教模型在当前上下文中选择下一步动作;专家/工具级样本则专门训练某一类工具的调用与结果解释。

这相当于把强 Agent 的行动方法拆成一套可学习的课程。学生模型学习的不只是最终标签,还包括如何发现证据缺口、如何修正失败的定位,以及何时停止继续调用工具。图 4 展示的多类案例也说明,距离、计数、路线、尺寸和方向判断都可以被组织成可追踪的行动过程;对空间智能而言,行动过程由此成为比单一答案更重要的训练资产。



视频链接:https://mp.weixin.qq.com/s/3P_oyOJwRMkq_RaXbl7bUA

图 4|项目展示的多类真实推理案例,覆盖距离、计数、路线、尺寸与方向等任务。

从 “更大的模型” 转向 “更会行动的系统”

把这些素材串起来看,S-Agent 展示的是一条不同于单纯扩展参数规模的路线:让通用 VLM 专注于行动规划,把几何恢复交给专用工具,把跨帧一致性交给记忆,再用可检查的推理轨迹把能力蒸馏回更小的模型。

这套思路可以自然延伸到机器人导航与操作、AR/VR 空间助手、长视频问答、自动驾驶场景理解等任务。它们共同需要的,不只是看见物体,而是主动选择下一步观察、测量和验证,并持续维护物体在三维世界中的位置、朝向与变化。

从这个角度看,S-Agent 把空间智能的评价重点从 “模型有多大” 推向 “系统是否会行动”:能否判断证据缺口、调用可靠工具、沉淀场景状态,并把成功的行动链反哺给更小模型。

S-Agent 给出的方向已经相当明确:当一次猜测被改写为可追踪、可复用、可蒸馏的行动链,视觉模型就从 “看懂一帧” 走向 “理解一个空间”;空间智能也由此从静态问答迈入可执行、可积累、可迁移的 Agent 时代。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
高考699分农家女孩韩雅平已被清华录取,此前曾透露庞众望是自己榜样,两人将成为校友

高考699分农家女孩韩雅平已被清华录取,此前曾透露庞众望是自己榜样,两人将成为校友

极目新闻
2026-07-25 15:26:14
西媒:费兰和略伦特在伊维萨度假,两人海边举止亲密引热议

西媒:费兰和略伦特在伊维萨度假,两人海边举止亲密引热议

懂球帝
2026-07-25 15:10:05
我买了个OBD盒子,发现自己的车每小时生成25GB数据,并向17个服务器“告密”

我买了个OBD盒子,发现自己的车每小时生成25GB数据,并向17个服务器“告密”

硅屿手记
2026-07-23 19:54:10
CCTV5直播,中国男篮世预赛PK黎巴嫩,阿拉基伤退,郭士强卸压力

CCTV5直播,中国男篮世预赛PK黎巴嫩,阿拉基伤退,郭士强卸压力

体坛小快灵
2026-07-25 14:25:38
荷兰弟:你们怎么都知道我买了短裤?逛上海是老婆赞达亚做的功课!橙柿直击《蜘蛛侠》中国首映礼现场

荷兰弟:你们怎么都知道我买了短裤?逛上海是老婆赞达亚做的功课!橙柿直击《蜘蛛侠》中国首映礼现场

都市快报橙柿互动
2026-07-25 00:54:16
乒超联赛1-2不敌张煜东,王楚钦回应:这几天每天都在训练,可能状态思想不是很在线,在场上会突然出现对自己不满意的情况,就打不进去了

乒超联赛1-2不敌张煜东,王楚钦回应:这几天每天都在训练,可能状态思想不是很在线,在场上会突然出现对自己不满意的情况,就打不进去了

大风新闻
2026-07-25 14:43:06
菲尔兹奖得主邓煜不写作业、极少记笔记却稳坐年级第一,高中老师:全班叫他“围棋战神”,早年差点走上职业围棋道路

菲尔兹奖得主邓煜不写作业、极少记笔记却稳坐年级第一,高中老师:全班叫他“围棋战神”,早年差点走上职业围棋道路

大风新闻
2026-07-24 17:39:06
2年800万!詹姆斯加盟76人组建四巨头争冠 第二年球员选项

2年800万!詹姆斯加盟76人组建四巨头争冠 第二年球员选项

醉卧浮生
2026-07-24 23:46:36
从太空高速冲回地球后,马斯克家最大的飞船,此刻正漂在印度洋上

从太空高速冲回地球后,马斯克家最大的飞船,此刻正漂在印度洋上

果壳
2026-07-25 09:54:23
刘雨辰&黄雅琼官宣怀孕:小秘密终于可以告诉大家了

刘雨辰&黄雅琼官宣怀孕:小秘密终于可以告诉大家了

懂球帝
2026-07-25 14:37:05
携程的几个创始人

携程的几个创始人

舜口说
2026-07-25 10:45:07
知名主持人敬一丹被传离世!知情人曝最新状况:还在抢救中,有北京网友称“已经脑死亡”

知名主持人敬一丹被传离世!知情人曝最新状况:还在抢救中,有北京网友称“已经脑死亡”

火山詩话
2026-07-24 16:43:21
御用名医曝谢贤生前猛料,难怪被曝不许柏芝再嫁,三胎生父藏不住

御用名医曝谢贤生前猛料,难怪被曝不许柏芝再嫁,三胎生父藏不住

观察鉴娱
2026-07-24 10:01:00
男子在家里未拉窗帘裸体走动,被女邻居拍照发业主群曝光,性别一换怎么就变味了?

男子在家里未拉窗帘裸体走动,被女邻居拍照发业主群曝光,性别一换怎么就变味了?

Mr王的饭后茶
2026-07-24 18:01:26
震惊!将院士划为A2类,把菲尔兹奖、图灵奖等归入A3类,无锡高层次人才认定标准,引发全网热议

震惊!将院士划为A2类,把菲尔兹奖、图灵奖等归入A3类,无锡高层次人才认定标准,引发全网热议

火山詩话
2026-07-25 06:43:38
阿里被罚42亿,震惊全网!

阿里被罚42亿,震惊全网!

财经三分钟pro
2026-07-23 15:46:38
全国养老金上调通知已下发,各地补发发放流程,会同步落实吗?

全国养老金上调通知已下发,各地补发发放流程,会同步落实吗?

你在偷看谁
2026-07-25 11:52:19
携程公布十九项整改措施:停止独家合作行为,保障酒店经营者自主经营权

携程公布十九项整改措施:停止独家合作行为,保障酒店经营者自主经营权

界面新闻
2026-07-25 15:10:49
詹姆斯被76人队裁掉后年薪损失了八百万美元,并且与另外四个超级巨星一起向世界发出挑战

詹姆斯被76人队裁掉后年薪损失了八百万美元,并且与另外四个超级巨星一起向世界发出挑战

不凡体育
2026-07-25 07:00:25
詹姆斯揭秘加盟76人原因:不为金钱只想再次夺冠 问鼎东部概率升第一

詹姆斯揭秘加盟76人原因:不为金钱只想再次夺冠 问鼎东部概率升第一

醉卧浮生
2026-07-25 00:16:24
2026-07-25 17:48:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13597文章数 142699关注度
往期回顾 全部

科技要闻

星舰13飞全中!20颗真卫星出舱

头条要闻

老父亲遇初恋后欲离婚分房款 女儿:防住前夫没防住亲爹

头条要闻

老父亲遇初恋后欲离婚分房款 女儿:防住前夫没防住亲爹

体育要闻

拿过两个金球奖,却说它只值10英镑

娱乐要闻

曝谢贤离世内情 难怪王菲缺席葬礼

财经要闻

滥用市场支配地位 携程被罚没51.79亿元

汽车要闻

精致硬汉 吉利银河战舰700是台不一样的方盒子SUV

态度原创

教育
游戏
房产
健康
公开课

教育要闻

父母为何成罪人付出的越多越遭嫌弃

《战神》新作晚公布早发售 顽皮狗再遭玩家鞭尸

房产要闻

37人抢1套房…海棠湾资产拍卖,爆了!

教你三步快速识别中风

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版