网易首页 > 网易号 > 正文 申请入驻

ECCV 2026 | AgentVLN:让机器人导航进入Agent时代

0
分享至



近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。

例如,机器人完成一句简单的指令:

“穿过走廊,在窗户旁边找到椅子。”

机器人不仅需要 “理解” 这句话,还需要知道:“走廊在哪里? 窗户和椅子之间是什么空间关系?当前视角是否被遮挡?应该先往哪里移动?接近目标时如何避免碰撞?” 这就是视觉语言导航(Vision-and-Language Navigation, VLN)面临的核心问题:如何让智能体将自然语言指令转化为现实世界中的连续行动。

为此,AgentVLN 提出 “VLM-as-Brain” 的理念,让 VLM 负责高层认知决策,同时通过模块化技能库完成具体执行,从而实现更加高效、灵活的机器人导航,即:VLM Agent → Skill Calling → SLAM/Perception → Robot Navigation。

论文提出的 AgentVLN 在 R2R-CE 和 RxR-CE 等主流 VLN 基准上取得领先性能,同时仅使用 3B 规模模型,并支持 Jetson 等边缘设备实时运行。 该成果已被计算机视觉顶级会议 ECCV 2026 (European Conference on Computer Vision)录用。



  • 论文标题:AgentVLN: Towards Agentic Vision-and-Language Navigation
  • 代码链接:https://github.com/Allenxinn/AgentVLN
  • 项目主页:https://allenxinn.github.io/AgentVLN/
  • 数据集链接:https://huggingface.co/datasets/allenxinn/AgentVLN-Instruct

核心思路



AgentVLN 使得机器人不再要求一个巨大模型直接完成所有事情,而是让视觉语言模型负责:“理解任务目标、分析环境与调度不同技能”。 而具体执行,例如建地图、避障、移动和定位等功能则交给专门设计的技能模块完成。该工作将导航过程建模为部分可观测半马尔可夫决策过程,并将技能划分为感知层技能和规划层技能,让智能体根据环境状态动态调用不同能力。这种设计类似人类完成导航任务的方式:

看到环境 → 思考路线 → 行动 → 根据反馈调整。

机器人不需要每一步都重新学习,而是像人一样调用已有能力。同一个 AgentVLN “大脑”,可以根据不同机器人的身体能力,替换对应的底层技能模块,从而快速适配不同机器人平台。



通过插件式底层技能库设计,AgentVLN 可以在不重新训练大规模视觉语言模型的情况下,通过扩展或替换技能实现对新环境和新任务的适应。

把 3D 世界 “翻译” 为 VLM 能看懂的 2D 提示

视觉语言模型最大的优势,是理解二维图像中的语义信息。 但机器人导航的问题在于:真实世界是三维的。机器人需要知道:“应该往哪里走?”,而 VLM 看到的是:“图片里的哪个位置代表目标方向?”,如何连接这两个空间,一直是机器人自主导航领域的重要挑战。





为此,AgentVLN 提出:跨空间表示映射机制(Cross-space Representation Mapping)。其核心思想是:先利用 SLAM 作为感知技能计算真实环境中的可行路径,再将三维路径信息映射回二维图像空间,让 VLM 直接在视觉空间中进行决策。

机器人首先调用感知技能,对当前环境进行分析:1)构建三维空间地图;2) 获取环境拓扑结构;3)计算可通行区域;4)生成候选导航路径点。 随后,AgentVLN 利用相机模型,将这些三维可行路径点投影到当前摄像头视角下的二维图像中。最终,原本复杂的三维路径规划问题,被转换为:

“在图像中选择最符合语言指令的路径点。”

也就是说,模型不再需要直接从开放空间中预测一个精确坐标,而是将:开放性的精细点坐标生成问题(open-ended coordinate generation)转化为:基于视觉提示的路径选择问题(choice-based selection)。

这种方式充分发挥了 VLM 强大的视觉语义理解能力,同时避免其直接进行复杂三维几何推理。该机制通过将感知层计算得到的三维路径点投影到二维图像平面,生成像素级对齐的视觉提示,使 VLM 能够直接在视觉空间中选择符合指令的路径,并进一步恢复为三维导航控制信息。

上下文驱动的自我纠错机制

现实物理环境下,机器人可能遇到:“家具遮挡、光线变化;摄像头看不到目标;行进过程中产生误差。” 如果机器人一直按照原计划前进,小错误可能不断累积,最终导致完全偏离目标。

因此,AgentVLN 加入了上下文驱动的自我纠错机制。当机器人发现:当前路线不可见;或者环境和指令不匹配;它不会盲目前进,而是主动执行探索动作:转身观察; 调整方向; 搜索新的路径。

该机制能够在遮挡、盲区以及轨迹偏移情况下生成细粒度探索动作,从而减少长期导航中的误差累积。

主动调用感知技能补足空间信息

AgentVLN 提出 Query-Driven Perceptual Chain-of-Thought(QD-PCoT),让机器人具备 “主动获取信息” 的能力。其核心思想是:

当模型无法确定目标位置时,不再盲目预测,而是主动提出问题,并调用感知技能补充缺失信息。

当机器人无法判断椅子的距离时,会主动询问:

“前方椅子距离我有多远?”

随后调用深度感知模块获取空间信息,并结合反馈完成目标定位。相比直接回归目标坐标的方法,QD-PCoT 将导航过程转变为:

主动提问 → 获取信息 → 更新认知 → 决策行动

从而赋予机器人类似人类的 “自我认知” 能力,使其能够判断 “自己缺少什么信息”,并主动调用相应技能完成补充。论文实验表明,引入 QD-PCoT 后,AgentVLN 在无需增加额外参数的情况下进一步提升导航性能,有效缓解二维视觉中的深度歧义问题。

VLN 模型的端侧部署

很多先进视觉语言模型参数规模巨大,需要依赖云端服务器推理计算。AgentVLN 选择轻量化路线,采用 Qwen2.5-VL-3B 作为核心底座模型,并通过模块化设计避免额外的大规模三维视觉模块,实现了在 Jetson 边缘设备上的本地运行。



AgentVLN 不仅在多个 VLN 基准测试中超过已有方法,同时保持较小参数规模。研究团队将系统部署在四足机器狗、人形机器人平台上,通过摄像头获取环境信息,再利用感知技能完成地图构建和路径规划。





结语

AgentVLN 让机器人不再依赖一个庞大的端到端模型解决所有问题,而是赋予 VLM “大脑” 的角色:负责理解任务、分析环境和决策规划,再通过技能调用连接 SLAM、定位和控制模块,完成真实世界中的自主行动。未来,随着大模型推理能力不断增强,以及机器人感知、运动和操作技能持续完善,机器人有望从 “被预先编程执行任务”,逐渐走向 “理解目标、自主规划、主动学习”,真正成为能够与物理世界交互的智能体。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全国各大寺院陷入倒闭潮,不是顾客少了,而是自己把自己拖垮了!

全国各大寺院陷入倒闭潮,不是顾客少了,而是自己把自己拖垮了!

风干迷茫人
2026-07-06 18:12:51
戴安娜弟弟新书爆料:查尔斯曾电话里低声说"我们很快就会忘了她"

戴安娜弟弟新书爆料:查尔斯曾电话里低声说"我们很快就会忘了她"

赴一场山海啊
2026-09-17 20:01:04
离谱血亏!阿森纳 1000 万甩卖世界级神锋!巴萨捡漏封神

离谱血亏!阿森纳 1000 万甩卖世界级神锋!巴萨捡漏封神

奶盖熊本熊
2026-09-18 07:56:53
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
新股提示:力勤资源今日申购

新股提示:力勤资源今日申购

每日经济新闻
2026-09-18 08:05:04
狱友问我怎么进来的,我:贪10个亿。狱警上来就是一脚:装什么

狱友问我怎么进来的,我:贪10个亿。狱警上来就是一脚:装什么

悬案解密档案
2026-02-26 15:34:48
中国移动董事长陈忠岳最新消息!

中国移动董事长陈忠岳最新消息!

最通信
2026-09-17 20:23:45
CBA新赛季赛程出炉!球迷:联赛正走向自毁模式

CBA新赛季赛程出炉!球迷:联赛正走向自毁模式

体育哲人
2026-09-17 18:37:11
赖昌星前妻近状曝光:拒绝政府安置,独居3000平老宅,只做一件事

赖昌星前妻近状曝光:拒绝政府安置,独居3000平老宅,只做一件事

人生录
2026-06-01 13:52:39
巨乳完美契合!导演亲荐《生化》电影八尺夫人选角

巨乳完美契合!导演亲荐《生化》电影八尺夫人选角

游民星空
2026-09-16 17:11:35
凯恩也坐不住了!为金球下场,与姆巴佩亚马尔开撕:73球说明一切

凯恩也坐不住了!为金球下场,与姆巴佩亚马尔开撕:73球说明一切

小金体坛大视野
2026-09-18 09:16:52
范玮琪被传曾说“陈建州好险没去日本,不然会像大S一样”,公司紧急声明

范玮琪被传曾说“陈建州好险没去日本,不然会像大S一样”,公司紧急声明

南方都市报
2026-09-18 09:48:40
一周内三起“拒赔案”,撕掉了新能源车“终身质保”的遮羞布?

一周内三起“拒赔案”,撕掉了新能源车“终身质保”的遮羞布?

马拉车市
2026-09-16 17:41:14
70国齐聚中国,菲方携史上最大团赴会,中国给了菲国一个特殊身份

70国齐聚中国,菲方携史上最大团赴会,中国给了菲国一个特殊身份

关系新篇章
2026-09-18 06:45:18
赛力斯往后只能靠自己了

赛力斯往后只能靠自己了

未来之地
2026-09-15 19:58:50
这跟没穿有何不同?35岁女星直播穿搭引发争议,大胆露背几乎走光

这跟没穿有何不同?35岁女星直播穿搭引发争议,大胆露背几乎走光

寒士之言本尊
2026-09-16 16:03:37
一年两次来华?确定特朗普会来深圳APEC,但住宿安排他说了不算

一年两次来华?确定特朗普会来深圳APEC,但住宿安排他说了不算

井普独白
2026-09-17 15:35:11
解放军重磅点名郭德纲!三大强烈信号出炉,赵本山三次忠告全应验

解放军重磅点名郭德纲!三大强烈信号出炉,赵本山三次忠告全应验

介知
2026-09-17 09:02:24
热身赛:广东战平蒙古联赛冠军!徐杰卢卡发挥出色,宏远两人受伤

热身赛:广东战平蒙古联赛冠军!徐杰卢卡发挥出色,宏远两人受伤

多特体育说
2026-09-17 23:05:28
江西女教师回娘家探亲失联12年,连续三天托梦哥哥:我在香炉里

江西女教师回娘家探亲失联12年,连续三天托梦哥哥:我在香炉里

悬案解密档案
2025-05-17 14:08:37
2026-09-18 12:16:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14016文章数 142733关注度
往期回顾 全部

科技要闻

苹果店外黄牛蹲守:18 Pro Max加价500

头条要闻

造谣"南医大坠亡学生遭导师压榨" 两账号被处置

头条要闻

造谣"南医大坠亡学生遭导师压榨" 两账号被处置

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

敬一丹逝世 央视送别,女儿成“心病”

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

房产
旅游
数码
教育
公开课

房产要闻

突发!三亚安居房出台新政!

旅游要闻

黑龙江双彩虹横跨稻田好梦幻

数码要闻

千元价位32寸2K 100Hz屏!联想来酷XQ32q显示器上市

教育要闻

从“减法”到“人生得失”:介词minus的语义底层逻辑与考点全解

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版