网易首页 > 网易号 > 正文 申请入驻

让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架

0
分享至



如果你问一个人 “杯子在哪?”,他通常会直接用手指给你看,而不是面无表情地回答:“目标位于屏幕横坐标 345 至 412、纵坐标 512 至 600 的边界框内”。然而,在现有空间认知评测中,我们却一直在强迫 AI 用这种 “反直觉” 的坐标方式来证明自己的空间认知能力。



空间判断本来就活在连续的视觉场景里,但现有 benchmark 几乎都要求模型用坐标、选项或文字作答。这对文本 VLM 已不够自然,天然工作在像素空间、本可直接 “画” 出答案的图像生成模型更是被挡在门外。

生成式模型会不会是承载空间认知更自然的载体?如果让模型直接把答案 “画” 出来,怎样让它把空间判断表达清楚?在不依赖人工的情况下,如何准确判断它画得对不对?进一步看,生成式模型与文本输出 VLM 在不同空间任务上的能力差异究竟在哪里?

近日,浙江大学 OmniAI 团队在《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》中提出 ProVisE,让图像生成模型直接在图中回答空间问题,并将视觉答案还原为原 benchmark 可以评分的结构化预测。



  • 论文链接:https://arxiv.org/abs/2607.21072
  • 项目地址:https://zju-omniai.github.io/ProVisE/
  • Github 链接:https://github.com/ZJU-OmniAI/ProVisE
  • Benchmark 链接:https://huggingface.co/datasets/wx91726/SpatialGen-Bench



视频链接:https://mp.weixin.qq.com/s/M78bQEqADqvY4GufqZ4-iA

ProVisE:生成模型如何 “画出答案”?

为了让生成模型能够以自己擅长的方式回答空间问题,我们提出了 ProVisE(Protocolized Visual Evaluation)框架。它不再要求模型输出干巴巴的文本或坐标,而是通过视觉协议,引导模型直接在图像上 “作答”:标记目标、填充方向网格、生成深度图、涂出目标区域,或者画出机器人的运动轨迹。

视觉协议是 ProVisE 的基本单元。每套协议都包含一段 guidance prompt,规定模型应该怎样展示答案;同时配有对应的 parser,将生成图像中的颜色、位置、区域等恢复为结构化预测。

整个流程可以概括为三步:首先,Protocol Router 根据任务选择合适的视觉协议;随后,图像生成模型按照 Guidance Prompt 产生可解析的视觉答案;最后,Protocol Parser 将像素结果转换成原 benchmark 所需的标签、点、掩码、状态或轨迹。



文本输出 VLM 直接生成结构化答案;图像生成模型通过视觉协议生成图像答案,再由 parser 恢复为原任务所需的预测。

Agentic Builder:自动化构建视觉评测协议

为了应对形式各异的空间 benchmark,我们在 ProVisE 中内置了Agentic Protocol Construction框架,根据任务的输入、答案结构和评分规则,自动构建相应的 “生成 — 解析” 协议。



Agentic Builder 根据任务选择 Reuse、Build 或 Fallback 路径,构建并验证对应的视觉协议。

Agentic Builder 逐任务扫描数据、输入形式、答案结构和评分规则,将其统一为任务规范;随后根据任务特点选择三种协议构建模式:

  • Reuse:直接复用兼容的已有协议
  • Build: 利用已注册的解析组件组装新协议
  • Fallback: 在确定性组件无法覆盖时,由辅助 VLM 解析生成图像并恢复结构化预测

协议构建完成后还需经过验证,确保视觉答案能够正常生成、解析并接入原指标;通过后即被冻结,用于所有图像生成模型的评测。

正如下图例子展示,模型可以直接把目标公交车点出来,把机械臂的移动轨迹画在原图上;判断 A、B 两点谁更近时,就生成一张深度图。面对 “缆车上还能否再坐一个人” 这样的问题,模型会把第二位乘客补到座椅上,直观展示空间是否足够。随后,相应的解析器再将这些图像答案转换为坐标、选项或轨迹。





图中展示了图像生成模型从任务输入、视觉作答到结果解析与评估的完整过程。

SpatialGen-Bench:全面刻画空间认知能力

为了系统描绘空间认知能力,我们构建了 SpatialGen-Bench,涵盖从直接视觉感知、场景理解、空间推理到具身交互的 14 项子任务:

  • 空间感知:考察模型从画面中提取基础几何与空间属性的能力,包括计数、相对深度、朝向和尺寸比较
  • 空间理解:要求模型整合多个物体及不同视角的信息,形成对物体关系与整体场景的理解,包括目标 grounding、关系分析、视角判断和场景建模
  • 空间推理:在场景理解基础上,检验模型能否结合空间关系和物理约束进行多步推演,包括多步推理、状态预测和几何可行性判断
  • 空间交互:进一步将空间认知延伸至行动,考察模型能否据此作出决策,包括可供性 grounding、导航和轨迹规划



SpatialGen-Bench 将 14 项任务组织为感知、理解、推理和交互四个层级。

Leaderboard

Claude Fable 5 与 GPT-5.6 Sol 均超过 80 分,与 Kimi K3 一起霸榜前三,GPT-5.4 得分为 61.04;图像生成模型中,GPT-5 Image 2 以 54.49 分排名第一。



生成模型的空间能力怎么样?

在 SpatialGen-Bench 上,我们比较了 20 个文本输出 VLM 和 11 个图像生成模型。结果显示,两类模型的优势集中在不同任务上:

1.图像生成模型展现出更直接的 “空间直觉”。当任务可以直接用深度图或空间标记回答时,生成模型表现出较强竞争力。直接在像素空间作答,减少了将连续空间关系转换成文字时的信息损耗。



左:两类模型在不同空间任务上的相对优势;右:图像生成模型的失败归因。

2. 在 GPT-5.4 做错的题目中,GPT Image 2 做对了 37%。两类模型做对的并不是同一批题,因而具有明显的互补性。



3.文本输出 VLM 在需要抽象推理的任务上仍占优势。计数、尺寸比较、几何可行性和状态预测,需要统计多个对象、比较尺度、组合几何约束或推演状态变化;在空间推理层级,VLM 组平均领先 17.6 个百分点。

4.生成成功并不意味着空间答案正确。失败归因显示,88.03% 的失败样本已经生成图像并解析出有效预测,只是预测结果错误。主要问题不是图像没有生成或无法解析,而是图中呈现的空间状态不准确。

总结与展望

我们希望这项工作提供一种新的空间智能视角。真正理解物理世界的智能体,不应只是会计算坐标的 “文本机器”,还应能够在像素空间中直接表达并预演空间状态。未来系统也不必在 Show 与 Tell 之间二选一:文本或 latent 表示承担约束规划与组合推理,视觉生成负责呈现空间状态,再由确定性工具完成验证。理解、生成与验证的协同,或许比单纯扩大任一类模型的规模更接近通用空间智能。

团队介绍

浙江大学 OmniAI 团队致力于大模型与智能体、多模态空间推理、具身智能和情感交互等方向的研究。作者王旭为大四本科生,已拟录取至浙江大学;姚凯翔为硕士一年级研究生。张文祺与张旭鸿为共同通讯作者,张旭鸿为 OmniAI 团队负责人。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
批评中国20年的加拿大华裔,去了洛杉矶3天后,说要给中国人道歉

批评中国20年的加拿大华裔,去了洛杉矶3天后,说要给中国人道歉

掉了颗大白兔糖
2026-08-25 04:11:32
德甲官网:樊振东让杜塞成第一热门,雨果独得两分豪言带萨尔夺冠

德甲官网:樊振东让杜塞成第一热门,雨果独得两分豪言带萨尔夺冠

杨华评论
2026-08-27 08:25:57
从177到115斤,我才明白:清掉内脏脂肪,才是瘦下来的根本原因

从177到115斤,我才明白:清掉内脏脂肪,才是瘦下来的根本原因

解说阿洎
2026-08-14 01:01:23
2亿60后集体退场,为何说中国再也不会有这代人?

2亿60后集体退场,为何说中国再也不会有这代人?

小怪吃美食
2026-08-25 04:44:10
95年我当上副营,帮助一名战士考上军校,28年后他给我一个惊喜

95年我当上副营,帮助一名战士考上军校,28年后他给我一个惊喜

红豆讲堂
2025-03-09 09:15:07
最新 | 又反转!1.9万已全额退款!死亡老人亲属:将追责!

最新 | 又反转!1.9万已全额退款!死亡老人亲属:将追责!

天津广播
2026-08-27 09:48:07
男子按摩店选了最贵的套餐,老板娘亲自服务4小时后,一言难尽

男子按摩店选了最贵的套餐,老板娘亲自服务4小时后,一言难尽

皮蛋儿电影
2026-07-24 09:40:33
拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

旧窗老街
2026-02-23 01:50:19
天通苑静了,北漂人却慌了:房租吞噬一切的时代,留下还是离开?

天通苑静了,北漂人却慌了:房租吞噬一切的时代,留下还是离开?

靓仔情感
2026-08-26 13:08:24
太丢脸了!加州亿万富豪被钓鱼执法,花140美元嫖娼当场被抓

太丢脸了!加州亿万富豪被钓鱼执法,花140美元嫖娼当场被抓

大洛杉矶LA
2026-08-26 04:23:08
24岁男孩从大山考入中山大学一路读到博士,确诊胃癌晚期,已化疗25次,本人回应:要不是考上中大,我可能已经不在了

24岁男孩从大山考入中山大学一路读到博士,确诊胃癌晚期,已化疗25次,本人回应:要不是考上中大,我可能已经不在了

极目新闻
2026-08-25 22:34:52
山姆那个羽衣甘蓝跟疯了一样

山姆那个羽衣甘蓝跟疯了一样

硬核的半佛仙人
2026-08-25 12:26:22
穆帅收服26岁巨星!进1球+1助攻被换,笑着下场和上赛季判若两人

穆帅收服26岁巨星!进1球+1助攻被换,笑着下场和上赛季判若两人

体育知多少
2026-08-27 06:04:41
47死34伤!摆摊被没收,领不到养老金,老人为报复公交车点燃汽油

47死34伤!摆摊被没收,领不到养老金,老人为报复公交车点燃汽油

易玄
2026-08-02 02:08:06
东契奇夜店狂欢到凌晨2点,身边还有34岁花花公子模特

东契奇夜店狂欢到凌晨2点,身边还有34岁花花公子模特

赛场速报局
2026-08-26 12:08:36
底层的戾气越来越重了。

底层的戾气越来越重了。

东亚财评V
2026-08-25 19:01:27
砸神像,睡坟地,结阴婚,“反迷信”网红张树林,如今怎么样了?

砸神像,睡坟地,结阴婚,“反迷信”网红张树林,如今怎么样了?

皮皮电影
2026-08-23 10:20:22
西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

史之铭
2026-08-25 17:15:36
自欺欺人!传音新机号称屏幕“0边框”,博主上手效果尴尬

自欺欺人!传音新机号称屏幕“0边框”,博主上手效果尴尬

泡泡网
2026-08-25 14:15:21
龙赛罗:皇马下半场展现了真正的潜力,穆帅让每个人都投入其中

龙赛罗:皇马下半场展现了真正的潜力,穆帅让每个人都投入其中

懂球帝
2026-08-27 09:33:09
2026-08-27 10:23:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13853文章数 142727关注度
往期回顾 全部

科技要闻

苹果邀请函:新CEO、折叠屏iPhone都要来了

头条要闻

"扶老人被索赔1.9万"死者亲属:外面热还继续"拖"老人

头条要闻

"扶老人被索赔1.9万"死者亲属:外面热还继续"拖"老人

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包贝尔承认将柳岩推下水片段引爆热搜

财经要闻

英伟达,营收翻倍大增,指引碾压预期

汽车要闻

搭华为ADS 5/增程纯电可选 阿尔法T7预售13.78万起

态度原创

健康
数码
亲子
教育
时尚

孩子刷短视频成瘾?9大成瘾真相

数码要闻

小米推出米家弹盖保温杯2,众筹价79元

亲子要闻

每天500亿活菌,6周后怎样了?一项多动症研究:3种有益菌增加,睡眠有所改善

教育要闻

中小学做好师德师风建设的4个建议

夏天上衣可以多穿黑色,不显花哨、不显胖,百搭经典又耐看

无障碍浏览 进入关怀版