![]()
不建图、不记忆、零训练:coding-agent 被直接扔进屋里,导航成绩反超工业级专用模型。
给它一只单目摄像头、四个动作按键,剩下什么都不给。
来自阿德莱德大学吴琦(Qi Wu)团队的一项新研究干了一件听起来有点大胆的事:把 coding-agent(就是 Claude Code、Codex 这些天天用来写代码的 AI 工具)原封不动地接上机器人,让它在陌生的房子里按语言指令导航。
不给地图,不给记忆模块,不给路径点预测器,不做任何导航训练,连一行领域代码都不写。
结果:在视觉语言导航(VLN)最经典的 R2R-CE 基准上,这个「裸奔」的通用 Agent 跑出了78% 成功率,追平甚至超过了最近一批用大规模数据专门训练出来的工业级导航模型。
作为参照:人类在这个基准上的成绩是 94%。
![]()
- 论文:Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation
- arXiv:https://arxiv.org/pdf/2607.26148
- 项目主页:jianzhou0420.github.io/mip
![]()
一图看懂这篇论文。左:三条路线的区别在「谁主导决策循环」:policy 是一张网络每步出动作,workflow 是固定流水线,agentic 是模型自己掌舵。中:最小接口探针,一个 coding-agent,一路单目相机,四个动作,别的什么都没有。右:R2R-CE 主结果。
这事为什么反常识
先交代下背景。视觉语言导航是具身智能的经典难题:给机器人一句话,比如「出卧室,沿走廊走,在盆栽处右转,停在沙发旁」,它得在没见过的房子里走到指定位置。
过去这个领域有两条正统路线。
一条是训练专用策略模型:NaVid、StreamVLN、NavFoM 这些工作,用海量导航数据把「看到什么就怎么走」直接训进模型里。
另一条是工程化的零样本流程:比如开创者 NavGPT,以及后来的 MapGPT、SmartWay,不训练,但给大模型配上一整套脚手架:建地图、存记忆、路径点预测器、树搜索,用固定流程一步步喂。
中间还有大厂爱走的「快慢双系统」,训一个慢脑做规划、快脑出动作。方向本身很有前景,但目前的实现本质上还是固定流水线。
这些路线的共同预设是:通用大模型自己走不了这段路——要么替它练,要么替它搭。
这篇论文(作者管这套探测方法叫MIP,Minimal-Interface Probe,最小接口探针)偏要反着来:把所有脚手架全拆了,只留两个函数:
- observe():返回一张单目 RGB 照片
- step():前进一小步 / 左转 / 右转 / 停止
然后让推理模型自己决定每一步:自己看图、自己想、自己走,走错了自己发现、自己退回去重走。论文把这种组织方式称为agentic embodied control:推理模型直接掌舵每一个动作,推理和控制始终对齐。
![]()
它真的在这样干活。R2R-CE 第 10 集真实回放(mini-swe-agent × fable-5):左边是 agent 的逐步思考和 step()/observe() 调用,右边是它此刻看到的 512 × 512 单目画面。中间有个细节:撞了床角之后,它自己发现「我几乎没动」,然后主动调整角度绕了过去。
成绩单
在 R2R-CE val-unseen 随机抽取的 100 条路径上(全部零样本,不做任何训练):
![]()
SR = 成功率;SPL = 按路径效率加权的成功率,越高越少绕路;「上 arXiv」为各系统 arXiv 首发年月。路线按「谁掌控决策回路」分:policy=训练好的网络每步直接出动作;workflow=控制流由代码固定的分级流水线(与是否端到端训练无关);agent=模型自己掌舵每一步。
注意「导航机制」那一列:别人家写满了各种模块,它这里是——none。
三个有意思的发现
研究团队在三套 coding-agent 框架(mini-swe-agent、Claude Agent SDK、Codex CLI)× 多个前沿模型上跑完了整个消融矩阵,结论很干脆:
一、决定成绩的是模型,不是框架。换模型能拉开二十多个点,换 harness 只有几个点的差异。百行代码的开源 mini-swe-agent 和官方 SDK 打得有来有回。
二、「帮忙」可能是帮倒忙。团队试了给 Agent 强制接上一个训练好的路径点预测器,结果弱模型确实涨分,强模型在原本就高 SR 的任务上反而可能掉分。脚手架的价值在随模型能力上升而贬值。
三、但把工具「递过去」而不是「绑上去」,是另一回事。当路径点预测器作为可选工具提供、由 Agent 自己决定用不用时,fable-5 混合版在默认思考档就从68.3 ± 1.5%跑到76.7 ± 0.6%,而且环境步数减半、总耗时只有纯裸奔版的四分之一。作为对照,同一个预测器强制「绑上去」只有 69% 的 SR。
![]()
三条消融轴,一张图。A:接口和 harness 都不动,只换模型,成绩从 5 分铺到 72 分;B:同一个模型换 harness,差距只有几个点;C:接口里塞进 waypoint 工具,弱模型大涨,强模型未必受益。
一行不改,换任务照跑
更有意思的是通用性测试:同一套循环、同一个 agent,不做任何针对性开发,直接换基准:
- VLNVerse 细粒度导航(100 题,提示词逐字没动):84% vs 专训模型 Qwen-RobotNav 的 64%
- HM-EQA具身问答(500 题;自主探索问答任务,终止动作换成 answer(),prompt 相应改成问答版):76.2% vs 带完整规划器部署态的 Qwen-RobotNav 76.7%
跨了任务、跨了模拟器,成绩没塌。
长程导航还是盲区
先泼盆冷水:78% 是短指令基准上的成绩。团队特意换上路线更长、指令更啰嗦的 RxR-CE 再跑(同一模型、同一框架),成功率直接掉到26%;就算把路径点预测器递给它,也只爬到 39%,比自己在 R2R-CE 上的成绩低了 30 个点。
掉分的同时,账单也在涨:每集耗时中位数从 187 秒涨到 527 秒,上下文翻了一倍多。路一长,历史观察越堆越厚,一个可能的原因是真正有用的线索反而被稀释了。论文没有下定论,但把话挑明了:长程导航目前还是这套玩法的盲区,也是下一步要啃的骨头。
也上了真机,也有翻车现场
团队还把同一个 Agent 部署到了宇树 Go2 机器狗上,在两个真实室内场景跑了31 条诊断任务。这批任务是手工设计的,普遍比标准 VLN/EQA 基准更刁钻:有的指令埋着要先观察世界才能判断的条件分支(「出门后看左边,如果只有一个垃圾桶就走过去停下,是多个就改去电梯」);有的要求边走边数数,还不能数重(「数数这间屋里有几把高椅子,矮凳不算」);有的要求多段折返回到之前经过的物体旁,还有专门测「身体意识」的过门任务。标准基准考「照路线走」,这批题考的是走路的同时还得动脑、记数、知道自己身子有多大。
能过的很利落:条件判断类(「如果门开着就……」)4/4 全过,汇报类 4/4 全过。
翻车的也很诚实:数数类 0/2 全挂,多阶段任务只过一半,过门时相机过去了身子没过去——Agent 不知道自己有个身体。
![]()
真机翻车实录(Go2 ep6,「出门」任务)。镜头刚探出门框,半米长的身子还没跟上:头卡在墙沿,agent 却根据画面判断自己「正望回房间里」,随后彻底迷失方向。看见门外,不等于身在门外,缺的是本体感觉。
模拟器里的失败分析同样坦率:30 个失败案例里,有 23 个 Agent 停下来时声称自己成功了。错误本身不致命,致命的是对错误毫无察觉。
划重点
- 通用推理模型 + 最小接口,零样本导航已能与工业级专训策略掰手腕
- 地图、记忆、搜索这些经典脚手架的收益正在被模型内化,强制外挂甚至可能起反作用
- 工具应该「可选地递给」Agent,而不是「固定地绑在」流程里
- 长时程、延迟、上下文增长仍是通往真正自主具身智能体(AutoEA,Autonomous Embodied Agent)的三道坎
论文由阿德莱德大学 AIML 吴琦(Qi Wu)团队主导,联合 CSIRO Data61 与昆士兰大学完成。作者:Jian Zhou*、Xunyi Zhao*、Gengze Zhou、Zerui Li、Sihao Lin、Jiajun Liu、Qi Wu(*共同一作)。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.