网易首页 > 网易号 > 正文 申请入驻

香港浸会大学的AI导航员:如何让机器人真正"看懂"前进的路?

0
分享至

来源:市场资讯

(来源:科技行者)


这项由香港浸会大学知识计算研究团队完成的研究,以预印本形式发布于2026年7月28日,论文编号为arXiv:2607.25337,感兴趣的读者可以通过该编号查阅完整论文。

**一段关于"地图"与"指南针"的故事**

假设你要去一个从未去过的城市参加一场重要会议,手头只有一本旧旅行日记——那是别人之前去过同一座城市留下的记录,里面写满了他每天走过哪些街道、花了多少时间到达目的地,但没有任何关于"哪条路最好走"的明确提示。你的任务是从这本日记里,自己摸索出一套判断"离目的地还有多远"的方法,然后用这套方法来指导自己的行走路线。

这个比喻,正是这篇论文要解决的核心问题所在。研究团队面对的是一个叫做"潜空间世界模型预测控制"的技术挑战,听起来复杂,但本质上和上面这个旅行问题一模一样:怎么让一个没有地图、没有GPS、只有旧日记的机器人,学会在脑子里"想象"出一条通向目标的好路?

**一、机器人的"脑补能力"从哪里来**

要理解这篇研究在做什么,先得搞清楚现代智能机器人是怎么学习的。传统的机器人学习方式,有点像让一个孩子反复对着照片描述"我看到了什么"——通过不断重建眼前的图像来理解世界。但这种方式既费力又低效,就像你每次回忆一个朋友的脸,都要在脑子里把对方的样貌从头画一遍一样。

后来研究者发现了一种更聪明的方式,叫做"联合嵌入预测架构"(Joint-Embedding Predictive Architecture,简称JEPA)。这种方式的思路是:与其让机器人把看到的图像原样复原出来,不如让它学会"预测接下来会看到什么",而且这种预测是在一个经过压缩的抽象空间里进行的,研究者把这个空间叫做"潜空间"。好比你不需要把朋友的脸画出来,只需要在脑子里记住"他是一个戴眼镜、留短发的高个子"这样的抽象描述,下次一看到类似特征就能认出来。

在这个框架下,有一个叫LeWM(Latent World Model,潜世界模型)的系统做得相当不错。它训练了一个"编码器"把观察到的图像压缩成抽象描述,再训练一个"预测器"根据这些描述和机器人的动作预测下一步会发生什么。当机器人需要规划行动时,它会在脑子里"模拟"多条可能的行动路线,然后选出那条让自己最接近目标的路线。判断"哪条路最接近目标"的方式,是直接量一下终点状态和目标状态在潜空间里的欧几里得距离——就是两个点之间最直的那条直线距离。

这个方案有它的道理:如果两个状态在抽象空间里距离很近,那它们在现实中也应该比较接近。然而,香港浸会大学的研究团队发现了一个根本性的裂缝。

**二、旅行日记里的隐藏信息**

问题出在哪里?回到之前的旅行日记比喻。LeWM的方式相当于:你看两个地点在地图上的直线距离,然后以此判断要花多少时间走到那里。但实际上,两点之间可能有一条大河阻隔,绕路要花三倍时间;或者有一条捷径让你一下子就到了。直线距离并不等于"走过去需要多少步"。

研究团队用一个叫做Push-T的机器人操控任务做了验证。这个任务里,机器人要把一个T形积木推到指定位置。他们从实验记录里抽出一对一对的状态,测量它们在潜空间里的欧几里得距离,然后对比这两个状态之间实际相差了多少个操作步骤。结果发现,LeWM的潜空间距离和真实的步骤差之间的相关性(斯皮尔曼相关系数)只有0.65——也就是说,这个"距离感"有相当大的误差。更直白地说,潜空间里"看起来很近"的两个状态,在实际操作中可能需要绕很多弯路才能到达。

这个裂缝,就是研究者所说的"训练-规划鸿沟"(train-plan gap):JEPA系统训练时学的是"预测下一步会是什么",但规划时需要的是"哪条路走起来最省力"。这两件事用的是同一套潜空间,但并没有人专门把这个空间调校成适合导航的样子。

香港浸会大学的团队由此提出了一个关键问题:旧日记本身——也就是那些没有奖励信号的示范轨迹数据——里面其实已经藏着时间顺序的信息。日记里第5天到第20天之间走了15天,这本身就告诉你两个地点之间大概需要多少步。能不能从这些纯粹的步骤顺序信息里,挖掘出一套真正适合规划的"进度尺"?

**三、时间距离:从日记里挖出的指南针**

为了解决这个问题,研究团队提出了一个新方法,叫做TD-JEPA(Temporal-Distance JEPA,时间距离联合嵌入预测架构)。这个名字里的"时间距离",就是那把从旧日记里挖出来的指南针。

TD-JEPA的基本骨架和LeWM完全一样:同样的编码器、同样的预测器、同样的防止系统"偷懒"的正则化方法(叫SIGReg)。新东西在于,研究团队在这个骨架上额外装了一个"时间感应器"——一个专门学习"从状态A到状态B需要多少步"的模块。

具体来说,这个时间感应器用了一种叫做度量残差网络(MRN,Metric Residual Network)的结构来定义一种"有方向的距离"。为什么要强调"有方向"?因为现实中的行进往往是不对称的——从山脚走到山顶和从山顶走到山脚,花的力气完全不一样。同样,机器人把积木从A位置推到B位置,和从B推回A,需要的步骤数可能大相径庭。传统的欧几里得距离是对称的(A到B和B到A一样远),但真实的到达代价不是。这个新的距离函数由两部分组成:一部分是对称的,捕捉两个状态的共同特征;另一部分是不对称的,专门描述"从这里到那里"的方向性差异。两部分加起来,得到一个永远非负、而且方向感正确的"前进代价"函数,记作d_ψ。

有了这个函数形式,还需要数据来"校准"它。研究团队的做法非常巧妙:从示范轨迹里取两个时间点i和j(i在前,j在后),它们之间的步数差j-i就是"时间标签",要求d_ψ学会把这对状态的代价估计到接近j-i。与此同时,他们还从不同轨迹里随机抓一些"负样本"——这些来自不同轨迹的状态对之间并没有直接的路径关系,所以它们的代价不应该很低,否则就是系统在"乱说话"。通过一个叫做Smooth L1的平滑损失函数来做回归,加上一个防止负样本代价过低的惩罚项,这套监督信号就让d_ψ真正地"理解"了步骤顺序的含义。

还有第三个新加入的成分:滚动一致性损失(rollout consistency loss)。规划的时候,机器人会在脑子里把未来五步的状态都模拟出来,然后看终点离目标有多远。研究团队发现,如果只训练"下一步预测",多步累积下来的误差会越来越大,就像每走一步都偏了一点点,走了五步以后就完全偏了方向。于是他们专门加了一个训练目标,让系统在模拟五步的时候,每一步的误差都尽量小,把预测的准确性和规划的深度绑在一起。

把这三个成分放到一起,完整的TD-JEPA训练目标就是:原来的一步预测损失,加上五步滚动损失,加上时间距离监督,再加上防坍缩的SIGReg正则化,四项各有权重地加权求和。

**四、两套角色,两种用法**

理解了TD-JEPA的构造之后,还有一个设计选择非常值得关注:学出来的d_ψ并不是在所有任务里都直接用于规划的。研究团队提出了一个"双角色"的设计哲学,并且根据任务的性质来决定用哪种方式。

在以拓扑结构为主的任务里——比如机器人要穿过两个房间找到目标,或者机器人手臂要伸向一个特定位置——"走了多少步"和"到达目标"之间的关系非常直接。在这类任务里,直接用d_ψ作为规划代价,就像真正拿着那把"时间指南针"来导航,效果非常好。

但在以精细接触为主的操控任务里——比如把T形积木精确推到指定角度,或者把一个立方体移到目标位置——"走了多少步"和"任务成功"之间的关系就复杂多了。积木在快要到位的最后几步,需要的是对当前几何姿态的精确感知,而不是"大方向上还有多远"。在这类任务里,研究团队反而选择继续用欧几里得距离作为规划代价,但用的是经过TD-JEPA时间训练之后的那个潜空间,而不是LeWM原始的潜空间。

这就好比说:时间距离训练让这个潜空间的"地图"变得更准确、更有结构,但在需要精细导航的最后阶段,你还是要看地图上的精确坐标而不是走路时间。时间训练的意义,在于让地图本身更好用,而不是强行替换掉所有的导航工具。

**五、实验结果:数字背后的故事**

研究团队在四个不同的任务环境里测试了这套方法,每个任务都代表一类典型的挑战。

第一个是Two-Room(双房间导航),机器人需要从一个房间穿过走廊到达另一个房间的目标位置。这是一个典型的拓扑导航任务。TD-JEPA在这里拿到了100%的成功率,而LeWM是97.4%,另一个叫RC-aux的对比方法是98.6%。虽然差距看起来不大,但这里存在一个有趣的训练动态:如果你追踪训练过程中每个epoch(训练轮次)的成功率,会看到前几轮成绩波动很大,到第五轮只有74%,然后从第六轮开始急速爬升,到第九轮达到100%。这条成长曲线说明,时间距离监督需要一定时间才能让系统真正"悟到"正确的导航方向感。

第二个是Reacher(机械臂伸向任务),机械臂要把末端移到一个随机指定的位置。TD-JEPA达到97%,LeWM是96%,RC-aux是96.8%。这里研究团队还发现了一个有趣的细节:在规划时,如果只看终点状态的代价,效果反而不如把整段轨迹上的平均代价也考虑进去(以0.3的权重混合)。原因在于,时间距离训练让整段路径的进度都有了意义,不只是最后一步。

第三个是Push-T(T形积木推送),这是那个用来说明"直线距离不等于行进步数"问题的任务。在这里,TD-JEPA用的是经过时间训练的潜空间,但规划代价用欧几里得距离,成功率达到86%,比LeWM的83.6%高了约2.4个百分点。

第四个是OGB-Cube(立方体操控),机器人要把一个三维立方体移到指定位置和方向。这是最复杂的操控任务。TD-JEPA在这里取得了最引人注目的提升:82.2%,比LeWM的68%高出了整整14.2个百分点,还略微超过了RC-aux的81.6%。这说明,即便在最后规划时用的是几何距离,经过时间训练的潜空间也能提供质量更高的状态表示,让距离计算更有意义。

从这四个数字来看,TD-JEPA在每个任务上都做到了"不比两个对手差"——这是研究团队设定的核心目标,也是他们最终实现的结果。

**六、拆开看:哪个零件最关键**

为了验证每个设计选择是否真的有用,研究团队做了一系列"拆零件"实验,专门在Push-T任务上测试。

去掉"有方向的残差"那部分,也就是把MRN结构换成一个普通的对称欧几里得投影——成功率从85%附近直接掉到57%附近,是最大的单项损失。这说明仅仅有时间标签的监督还不够,必须配合一个能表达方向性的函数结构,两者缺一不可。

去掉"跨轨迹负样本"那项惩罚——成功率降到77%附近。没有负样本,系统就可能在遇到来自不同轨迹的状态对时,给出莫名其妙的低代价估计,就像导游给你指路时,把你指向了一个完全不相关的目的地,因为他从没见过"错误的目的地"是什么样子。

去掉"五步滚动一致性"训练——成功率降到60%附近,比去掉负样本还要惨。多步预测的精度是规划能力的基础,如果系统在脑子里模拟五步以后误差已经积累得很大,那d_ψ再准确也救不了规划。

总结下来,这三个成分——有方向的代价函数结构、跨轨迹负样本、以及与规划视野对齐的多步一致性——共同构成了TD-JEPA超越基线的核心,缺少任何一个都会有明显的性能下降。

**七、为什么接触任务里时间代价反而不如几何距离**

一个值得深挖的现象是:在Push-T任务里,d_ψ在预测"步数相关性"上明显优于欧几里得距离(斯皮尔曼相关0.91对比0.79),但如果规划时直接用d_ψ,成功率反而只有69%,远低于用欧几里得距离的86%。这是不是矛盾?

研究团队通过记录每个失败案例的"失败位置"找到了答案。他们把每次推积木的过程分成两个阶段:接触前(机器人靠近积木)和接触后(积木被推动、调整角度)。在用d_ψ规划的时候,接触前阶段失败的次数很少,但接触后失败的次数非常多;而用欧几里得距离规划时,接触前几乎不失败,接触后失败次数也大幅减少。

这说明,时间代价d_ψ很擅长引导机器人"大方向上怎么走",但在需要精细调整积木角度的最后阶段,它提供的"进度感"反而会产生误导。研究团队还尝试了一种"接近目标时切换到几何距离"的混合策略,发现这确实比纯d_ψ好,但仍然比直接用几何距离差。根本原因在于,整个CEM规划过程中,几何信息在每一轮候选动作的筛选里都起着作用,不是仅仅在最后几步才需要。这个发现直接支持了研究团队的双角色设计哲学:任务类型决定了应该用哪把尺子来规划。

**八、这套方法在更大图景里处于哪个位置**

研究团队还把TD-JEPA和文献中更广泛的方法做了一个非正式的对比。他们特别指出,这个对比不是严格的头对头测试(因为不同方法用了不同的实验配置),只是一个参考。在这个参考框架里,TD-JEPA在Two-Room和Reacher上达到了文献报告中的最高水平,在OGB-Cube和Push-T上也处于竞争性水准。

相比于"价值引导的JEPA"方法(Value-Guided JEPA),TD-JEPA的最大区别在于:它不需要用强化学习来估计一个"价值函数",只需要轨迹里自带的时间顺序信息。这就像说,你不需要雇一个专门评估"这条路好不好走"的顾问,只需要从旅行日记的日期里自己推算出来。这个特性让TD-JEPA在完全没有奖励信号的离线数据场景下也能工作,适用范围更广。

相比于RC-aux(另一个同期出现的竞争方法),RC-aux的思路是教系统区分"在规划时间范围内能到达的目标"和"最终能到达但现在到不了的目标",但它最终规划时仍然用欧几里得距离。TD-JEPA则直接挖掘了一个可以用于规划的代价函数,思路上更主动、更直接。

说到底,TD-JEPA做的事情,本质上是给旅行者的旧日记本装上了一个"时间感"的解码器。这本日记里的每条记录,都隐含着"走到这里花了多少时间"的信息,而这个信息是判断前进方向最直接的依据——比在地图上量直线距离要靠谱得多。

研究团队证明,对于需要导航的任务,这把从日记里提炼出来的"时间指南针"确实能帮机器人找到更好的路;而对于需要精细操控的任务,这本日记的价值不在于直接用作指南针,而在于让地图本身变得更准确、更有结构,从而让普通的"量距离"方法也能发挥更大的作用。

这项研究揭示的核心道理,可能比它解决的具体问题更有启发意义:训练时学的东西和部署时用的东西,应该从一开始就放在一起设计,而不是训练完了再临时想办法适配。规划需要什么样的"进度感",就应该在训练阶段就把这种进度感的监督信号明确地写进去。当然,这个方法目前还依赖于一个假设:示范轨迹中的时间顺序可以作为"到达代价"的合理替代。当演示轨迹本身有很多迂回、或者不同轨迹之间的可达性差异很大时,这个假设会受到挑战,也是未来值得继续研究的方向。有兴趣深入了解完整细节的读者,可以通过编号arXiv:2607.25337查阅原始论文。

Q&A

Q1:TD-JEPA里的"时间距离"具体是什么意思,和普通的空间距离有什么区别?

A:普通的空间距离(欧几里得距离)就是两个状态在抽象空间里的直线远近,就像量地图上两点的直线距离。时间距离则是"从一个状态出发,按照演示数据里的轨迹,需要走多少步才能到达另一个状态"。TD-JEPA里的d_ψ专门学习这种步数差,而且它是有方向的——从A到B需要的步数,可以和从B到A完全不同,更符合现实中机器人操控任务的实际情况。

Q2:为什么Push-T任务里TD-JEPA的时间代价d_ψ排名准确性更高,实际规划成功率却反而更低?

A:因为"能准确预测步数差"和"适合指导精细操控"是两件不同的事。Push-T任务在积木接近目标位置的最后阶段,需要机器人对当前几何姿态(角度、位置)做精细调整,这时候"还需要多少步"的判断其实会产生误导。欧几里得几何距离在这个阶段能更准确地捕捉"积木现在的姿态离目标有多偏",从而给规划器提供更有效的引导信号。

Q3:RC-aux和TD-JEPA都是在LeWM基础上改进的,它们的核心区别是什么?

A:RC-aux的做法是在训练时加入"预算受限的可达性"监督,让系统学会区分"在规划时间步数内能到达的目标"和"终究能到达但现在还到不了的目标",但规划时仍然用欧几里得距离评分。TD-JEPA的做法是直接从轨迹时间顺序里挖掘一个有方向的代价函数d_ψ,这个代价函数既可以直接用于规划(拓扑任务),也可以通过改善潜空间结构来提升几何规划的质量(操控任务)。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国总统痛哭流涕,伊朗如果有能打到美国本土的导弹,美国国运休矣

美国总统痛哭流涕,伊朗如果有能打到美国本土的导弹,美国国运休矣

农夫史记
2026-08-06 20:53:18
野心配不上格局,一张旧照,道尽邹市明一家衰败的根源

野心配不上格局,一张旧照,道尽邹市明一家衰败的根源

东方不败然多多
2026-07-24 11:55:10
中超|北京国安主场4球零封深圳新鹏城,赛季首次升至积分榜第三

中超|北京国安主场4球零封深圳新鹏城,赛季首次升至积分榜第三

北青网-北京青年报
2026-08-07 22:32:04
张卫健当年霸屏的十部剧,收视率爆棚,你还记得几部?

张卫健当年霸屏的十部剧,收视率爆棚,你还记得几部?

小Q侃电影
2026-08-05 22:12:16
一年陪睡300次真相大白后,45岁张娜拉现状曝光,丝毫不感到意外

一年陪睡300次真相大白后,45岁张娜拉现状曝光,丝毫不感到意外

深析古今
2026-07-01 20:40:54
比失业更可怕的事,正在悄悄发生

比失业更可怕的事,正在悄悄发生

东亚财评V
2026-08-07 19:46:13
明星也开始“失业”,多位艺人自曝无戏可拍,有人早已另寻出路

明星也开始“失业”,多位艺人自曝无戏可拍,有人早已另寻出路

洲洲影视娱评
2026-08-07 13:35:01
菲律宾变了!一旦中菲开战,中国的这些岛礁恐怕真守不住了?

菲律宾变了!一旦中菲开战,中国的这些岛礁恐怕真守不住了?

无情有思可
2026-08-06 14:04:57
问题严重了,特朗普制裁中企后,中方还没出手,美国25州先出手了

问题严重了,特朗普制裁中企后,中方还没出手,美国25州先出手了

面包夹知识
2026-08-07 14:17:30
全体集合,下周的预测出来了!创新药强势,我来说两句!

全体集合,下周的预测出来了!创新药强势,我来说两句!

一担金
2026-08-07 13:18:16
广州市销量第一的汽车:几乎没有什么悬念,上半年销量达4513台

广州市销量第一的汽车:几乎没有什么悬念,上半年销量达4513台

柳先说
2026-08-07 18:56:35
王凯灵堂现场曝光!白花妆点「招牌灿笑照」暖哭众人 经纪人揭王妈妈现身安排

王凯灵堂现场曝光!白花妆点「招牌灿笑照」暖哭众人 经纪人揭王妈妈现身安排

ETtoday星光云
2026-08-07 13:11:06
邵逸夫离世前和挚友坦言:我手握两百亿资产却无子女愿意接手。我的四名孩子分毫不要,原因是其母亲过世时,我犯下难以弥补的过错

邵逸夫离世前和挚友坦言:我手握两百亿资产却无子女愿意接手。我的四名孩子分毫不要,原因是其母亲过世时,我犯下难以弥补的过错

唠叨说历史
2026-08-04 16:07:29
沙特、土耳其与巴基斯坦签署共同防务协议

沙特、土耳其与巴基斯坦签署共同防务协议

澎湃新闻
2026-08-07 19:23:17
小酒窝与爸爸高云翔合体,继承董璇优秀基因,往事如烟!

小酒窝与爸爸高云翔合体,继承董璇优秀基因,往事如烟!

小小一米月儿
2026-08-06 00:35:03
打不过就跑,这都什么毛病啊?

打不过就跑,这都什么毛病啊?

中国新闻周刊
2026-08-07 13:55:51
十年爱情长跑,荷兰弟如愿“嫁”给了赞达亚!成功追到梦中女神的还有他们……

十年爱情长跑,荷兰弟如愿“嫁”给了赞达亚!成功追到梦中女神的还有他们……

新民周刊
2026-08-07 14:16:43
森保一:日本从青训到国家队的培养体系,绝对没有输给世界

森保一:日本从青训到国家队的培养体系,绝对没有输给世界

懂球帝
2026-08-07 19:43:06
二婚搭伙19年的老伴去世后,他儿子给我转了35万,我以为是补偿

二婚搭伙19年的老伴去世后,他儿子给我转了35万,我以为是补偿

五元讲堂
2026-03-30 15:07:43
【中超】达万中两元张玉宁法比奥破门 国安4比0深圳

【中超】达万中两元张玉宁法比奥破门 国安4比0深圳

体坛周报
2026-08-07 21:46:14
2026-08-08 00:16:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4360227文章数 9200关注度
往期回顾 全部

科技要闻

突然涨价,"只收电费钱"的梁文锋,变了吗

头条要闻

穆杰塔巴被指给总统下"最后警告" 爆料人发声意味深长

头条要闻

穆杰塔巴被指给总统下"最后警告" 爆料人发声意味深长

体育要闻

去年信誓旦旦3000万 今年NBA查无此人

娱乐要闻

周也热恋结束,六个字暴露单身状态

财经要闻

腾讯WorkBuddy领跑AI办公 阿里字节急了?

汽车要闻

越7全球首秀 传祺开始进攻方盒子越野

态度原创

家居
健康
本地
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

打干细胞会不会诱发癌症?

本地新闻

课本里的童年,绍兴正上演

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

乌防空导弹严重短缺 泽连斯基公开喊话

无障碍浏览 进入关怀版