网易首页 > 网易号 > 正文 申请入驻

GAIR Paper 114 | FutureNav:基于国产芯片训练的世界-动作导航模型,让机器人学会「预见未来」

0
分享至


从单纯的动作模仿,推进到统一的世界-动作学习

作者丨FutureNav team

编辑丨齐铖湧

当机器人听到一句自然语言指令,例如“沿着楼梯上去,穿过门,在水槽旁停下”,它需要完成的远不止识别物体和预测下一步动作。它必须理解自己在哪里、刚刚经过了什么、当前动作会如何改变所处空间,以及下一刻可能看到怎样的环境。

近日,AI科技评论关注到,来自清华大学、鹏城实验室、香港科技大学(广州)、小米汽车和新加坡国立大学的研究团队提出的FutureNav,在这一领域做出了非常前沿的探索。FutureNav是一个面向连续视觉语言导航(Vision-and-Language Navigation, VLN)的统一 world-action 建模框架

论文题为“FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation”,已发布于 arXiv。

除了方法本身,FutureNav 还有一个工程亮点:模型训练阶段由国产AI加速算力芯片支撑。这意味着 FutureNav 的训练实践不仅展示了世界-动作建模在具身导航中的效果,也体现了国产 AI 算力平台对大规模视觉语言导航模型训练的支撑能力。

论文链接:https://arxiv.org/pdf/2606.30367

项目主页:

https://linglingxiansen.github.io/FutureNav/

代码仓库:

https://github.com/linglingxiansen/FutureNav

01


导航不能只靠“模仿下一步”


近年来,基于视觉语言模型(VLM)的导航基础模型发展迅速。许多方法将视觉历史和语言指令输入大模型,再让模型直接输出 MOVE_FORWARD、TURN_LEFT、TURN_RIGHT 或 STOP 等低层动作。这种范式简洁高效,但也存在一个关键问题:模型主要学习“从观察到动作”的映射,却缺少对世界状态和状态变化的显式监督。

在连续环境中,这个短板会被放大。机器人需要在长动作序列中保持空间记忆,理解地标、转向、通道、楼梯和目标位置之间的关系,还要避免早期错误不断累积。换句话说,一个可靠的导航智能体不仅要知道“下一步该做什么”,还要知道“执行这个动作后,世界会怎样变化”。

FutureNav 正是围绕这一点展开:把视觉语言导航从单纯的动作模仿,推进到统一的世界-动作学习。

02


四种能力,一个统一框架


FutureNav 以 VLM 为主干,并引入冻结的空间编码器来提取几何感知特征。语言指令、视觉观测和空间特征被统一送入语言模型,使模型在保留 VLM 语义理解能力的同时,获得更强的空间状态表征。

在训练阶段,FutureNav 同时优化四类目标:

1. 动作策略学习:根据语言指令和视觉历史预测下一步导航动作。

2. 逆动力学建模:根据前后两帧观测变化,反推出中间执行了什么动作。

3. 前向动力学建模:给定当前状态和动作,预测下一步空间状态。

4. 未来状态生成:不显式依赖动作 token,预测短时未来的空间状态。

这四个目标共同约束模型:它不仅学习“要执行什么动作”,也学习“这个动作对应怎样的状态转移”,以及“未来空间可能如何演化”。因此,FutureNav 的训练过程更接近真实导航所需的空间推理过程。


更重要的是,FutureNav 并没有牺牲推理效率。辅助的动力学和未来预测模块主要用于训练阶段塑造共享表示;在默认推理设置下,模型只保留动作策略分支进行直接动作解码,因此不会引入额外的在线想象、候选轨迹展开或规划成本。

03


4B 模型也能达到领先性能

论文在 R2R-CE 和 RxR-CE 两个标准连续 VLN 基准上进行了系统评测。结果显示,仅使用 4B 规模主干的 FutureNav,就能在多个指标上超过已有更大规模导航模型。


在完整训练设置下,相较 JanusVLN,FutureNav-4B 在 R2R-CE 上带来SR 提升 8.1%、SPL 提升 7.9%,同时导航误差 NE 相对降低 11.3%。FutureNav-8B 在 RxR-CE 上实现SR 提升 13.7%、SPL 提升 15.4%、nDTW 提升 11.3%,NE 相对降低 29.7%。

这些结果说明,FutureNav 的提升并不只是来自更大的模型或更多数据,而是来自更合理的世界-动作联合建模方式。值得注意的是,使用了国产芯片进行训练。这让 FutureNav 的意义不只停留在算法层面:它同时展示了国产算力平台支撑多模态具身导航模型训练、并产出国际竞争力结果的潜力。

04


不只是最终性能,更提升训练效率


消融实验进一步验证了 FutureNav 各个组件的作用。在不使用外部导航数据的 0K 设置下,单纯的 policy-only baseline 在 R2R-CE 上取得 50.1 SR / 45.1 SPL;加入全部 world-action 目标后,提升到 55.1 SR / 50.1 SPL,并将 NE 从 6.00 降低到 5.13。

其中,前向动力学、逆动力学和未来状态生成都带来了正向增益,说明这些目标提供的是互补监督,而不是简单重复动作标签。


论文还比较了不同潜变量表征:VAE latent、VLM visual latent、DINO semantic latent 和 spatial latent。结果显示,FutureNav 使用的空间潜变量效果最好,在 R2R-CE 0K 设置下达到 55.1 SR / 50.1 SPL,明显优于其他 latent 选择。这也印证了一个核心判断:对于具身导航而言,显式建模空间状态比单纯建模视觉外观更关键。


训练效率方面,FutureNav 在相同训练进度下持续优于 policy-only baseline。论文报告显示,FutureNav 在约 63% 训练进度时就达到 50.2 SR,已经接近 policy-only 模型最终的 SR 水平,体现出 world-action 监督对收敛效率的帮助。

05


从仿真到真实机器人


除了仿真基准,论文还展示了 FutureNav 的零样本真实环境部署。研究团队将模型部署在 H20 GPU 服务器上,并使用搭载 D435i 相机的 Go2 机器人进行实机导航。机器人接收自然语言指令和第一视角 RGB 观测,由服务器预测低层动作,再在真实室内外环境中执行。

在没有额外真实世界微调的情况下,FutureNav 能够根据可见地标完成导航,并在指定目标附近停止。这表明,训练阶段学到的世界-动作结构不仅提升了仿真指标,也有助于跨外观、光照和布局变化的真实场景泛化。

06


迈向具身导航的未来世界模型

FutureNav 的核心价值在于,它为 VLM 导航模型提供了一种更完整的训练范式:不再只把导航看成“观察到动作”的序列模仿,而是把动作策略、状态转移、逆向动作推断和未来状态预测统一到同一个框架中。

这种设计兼顾了三点:

• 空间理解更强:通过冻结空间编码器和 spatial latent 监督,增强模型对环境结构的感知。

• 动作决策更稳:通过正向/逆向动力学约束,提升动作与状态变化的一致性。

• 推理仍然高效:辅助 world-action 模块主要用于训练,默认推理只走策略分支。

对于视觉语言导航和具身智能研究而言,FutureNav 提供了一个清晰信号:下一代导航模型不能只会“模仿专家动作”,还需要理解动作如何改变世界,并在决策前形成对未来空间状态的内部预期。

FutureNav 正是在这个方向上的一次重要探索。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
谢贤遗产风波反转仅5天,张柏芝小儿子身世曝光,是我们误会了

谢贤遗产风波反转仅5天,张柏芝小儿子身世曝光,是我们误会了

生命之泉的奥秘
2026-07-31 07:38:29
“曝黄政民出轨”冲上热搜,韩国大满贯影帝被曝通话录音及聊天记录,经纪公司回应:已确认相关内容,目前正在整理立场

“曝黄政民出轨”冲上热搜,韩国大满贯影帝被曝通话录音及聊天记录,经纪公司回应:已确认相关内容,目前正在整理立场

鲁中晨报
2026-07-29 15:24:06
汗颜!石碑上4个草字,研究了半天,连1个都没认出来。能认全的书友水平肯定不低。

汗颜!石碑上4个草字,研究了半天,连1个都没认出来。能认全的书友水平肯定不低。

生活新鲜市
2026-07-30 16:02:44
退休人员偷着乐!每月养老金3000元以上,超过了80%的老人

退休人员偷着乐!每月养老金3000元以上,超过了80%的老人

社保小达人
2026-07-31 11:29:14
安亭的德国人走了,中国工厂的灯还亮着:教会徒弟真饿死师傅了?

安亭的德国人走了,中国工厂的灯还亮着:教会徒弟真饿死师傅了?

娱乐洞察点点
2026-07-31 02:32:00
印尼付清尾款反手“退货”:48架生产线不要了,韩国军工遭滑铁卢!

印尼付清尾款反手“退货”:48架生产线不要了,韩国军工遭滑铁卢!

菁菁子衿
2026-07-30 09:22:00
母亲再婚10年从没回过家,高考后接我去她新家,见到继父后我愣了

母亲再婚10年从没回过家,高考后接我去她新家,见到继父后我愣了

兰姐说故事
2024-12-13 14:30:03
球球曝赵本山晚年状态:每天2包烟8两酒,脑瘤术后只戒了俩月

球球曝赵本山晚年状态:每天2包烟8两酒,脑瘤术后只戒了俩月

子芫伴你成长
2026-07-29 22:06:27
毛泽东的特型演员古月,得急病20分钟后去世,有个生活习惯不太好

毛泽东的特型演员古月,得急病20分钟后去世,有个生活习惯不太好

历史甄有趣
2026-07-30 20:00:08
“我要下班了”医生被投诉拒诊要求重罚,卫健委:服务细节不足

“我要下班了”医生被投诉拒诊要求重罚,卫健委:服务细节不足

白宸侃片
2026-07-29 11:09:22
这次真来了!特斯拉中国推出重大系统更新

这次真来了!特斯拉中国推出重大系统更新

XCiOS俱乐部
2026-07-31 13:12:36
真慌了?国家队网约车杀到,抽成更低!滴滴坐不住了

真慌了?国家队网约车杀到,抽成更低!滴滴坐不住了

呼呼历史论
2026-07-31 03:46:45
16年前,大喊“我爸是李刚”的李启铭,出狱后父母拒绝与其相认

16年前,大喊“我爸是李刚”的李启铭,出狱后父母拒绝与其相认

麦芽是个小趴菜
2026-07-27 02:35:50
贵州贵定一景区被曝1988元可与“伴漂女子”抱抱亲亲,其他服务私下谈,当地通报:已联合多部门开展调查

贵州贵定一景区被曝1988元可与“伴漂女子”抱抱亲亲,其他服务私下谈,当地通报:已联合多部门开展调查

云南网络广播电视台
2026-07-31 09:57:45
2万欧项链说买就买!姆巴佩陪女友巴黎扫货,逛遍奢侈名店

2万欧项链说买就买!姆巴佩陪女友巴黎扫货,逛遍奢侈名店

潇湘烟雨水
2026-07-29 04:25:50
测试队友服从性?詹姆斯刚走,东契奇就开始立威,队友无人敢反对

测试队友服从性?詹姆斯刚走,东契奇就开始立威,队友无人敢反对

你的篮球频道
2026-07-30 14:45:46
7月起新规落地:50、55岁还在上班的人,加班、社保、辞退全变了

7月起新规落地:50、55岁还在上班的人,加班、社保、辞退全变了

细说职场
2026-07-30 17:28:24
菲政坛大地震!杜特尔特儿子当众宣战,菲两大政治豪门正式决裂?

菲政坛大地震!杜特尔特儿子当众宣战,菲两大政治豪门正式决裂?

晓旓就是我
2026-07-31 09:55:18
李嘉诚20亿仲裁没白打!巴拿马642艘船集体跑路,中方:按规矩办

李嘉诚20亿仲裁没白打!巴拿马642艘船集体跑路,中方:按规矩办

长风价值掘金
2026-07-30 14:12:48
双擎电池8年必坏? 92%是人为作死 ,改掉这习惯能省几万。

双擎电池8年必坏? 92%是人为作死 ,改掉这习惯能省几万。

周哥一影视
2026-07-30 16:13:16
2026-07-31 14:12:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7511文章数 20771关注度
往期回顾 全部

科技要闻

最多80%!GPT5.6官宣降价,中国厂商逼的?

头条要闻

华春莹同印度外交秘书对话后 外交部发声"支持印度"

头条要闻

华春莹同印度外交秘书对话后 外交部发声"支持印度"

体育要闻

菲尼克斯,止损后的漫漫长路

娱乐要闻

李小璐澄清夜宿门,被网友质疑想洗白

财经要闻

打新日确认!宇树科技IPO冲刺“冰与火”

汽车要闻

MG 07将是上汽的逆转时刻

态度原创

手机
健康
房产
本地
旅游

手机要闻

Caviar推出定制版三星Galaxy Z Fold 8,售价超1.2万美元

最近总忘事,我是要中风了吗?

房产要闻

太疯狂!海口刚刚,又抢地了!

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

旅游要闻

深圳这座300年的古镇如何留住游客?专家给出反直觉解法

无障碍浏览 进入关怀版