网易首页 > 网易号 > 正文 申请入驻

香港浸会大学的AI导航员:如何让机器人真正"看懂"前进的路?

0
分享至


这项由香港浸会大学知识计算研究团队完成的研究,以预印本形式发布于2026年7月28日,论文编号为arXiv:2607.25337,感兴趣的读者可以通过该编号查阅完整论文。

**一段关于"地图"与"指南针"的故事**

假设你要去一个从未去过的城市参加一场重要会议,手头只有一本旧旅行日记——那是别人之前去过同一座城市留下的记录,里面写满了他每天走过哪些街道、花了多少时间到达目的地,但没有任何关于"哪条路最好走"的明确提示。你的任务是从这本日记里,自己摸索出一套判断"离目的地还有多远"的方法,然后用这套方法来指导自己的行走路线。

这个比喻,正是这篇论文要解决的核心问题所在。研究团队面对的是一个叫做"潜空间世界模型预测控制"的技术挑战,听起来复杂,但本质上和上面这个旅行问题一模一样:怎么让一个没有地图、没有GPS、只有旧日记的机器人,学会在脑子里"想象"出一条通向目标的好路?

**一、机器人的"脑补能力"从哪里来**

要理解这篇研究在做什么,先得搞清楚现代智能机器人是怎么学习的。传统的机器人学习方式,有点像让一个孩子反复对着照片描述"我看到了什么"——通过不断重建眼前的图像来理解世界。但这种方式既费力又低效,就像你每次回忆一个朋友的脸,都要在脑子里把对方的样貌从头画一遍一样。

后来研究者发现了一种更聪明的方式,叫做"联合嵌入预测架构"(Joint-Embedding Predictive Architecture,简称JEPA)。这种方式的思路是:与其让机器人把看到的图像原样复原出来,不如让它学会"预测接下来会看到什么",而且这种预测是在一个经过压缩的抽象空间里进行的,研究者把这个空间叫做"潜空间"。好比你不需要把朋友的脸画出来,只需要在脑子里记住"他是一个戴眼镜、留短发的高个子"这样的抽象描述,下次一看到类似特征就能认出来。

在这个框架下,有一个叫LeWM(Latent World Model,潜世界模型)的系统做得相当不错。它训练了一个"编码器"把观察到的图像压缩成抽象描述,再训练一个"预测器"根据这些描述和机器人的动作预测下一步会发生什么。当机器人需要规划行动时,它会在脑子里"模拟"多条可能的行动路线,然后选出那条让自己最接近目标的路线。判断"哪条路最接近目标"的方式,是直接量一下终点状态和目标状态在潜空间里的欧几里得距离——就是两个点之间最直的那条直线距离。

这个方案有它的道理:如果两个状态在抽象空间里距离很近,那它们在现实中也应该比较接近。然而,香港浸会大学的研究团队发现了一个根本性的裂缝。

**二、旅行日记里的隐藏信息**

问题出在哪里?回到之前的旅行日记比喻。LeWM的方式相当于:你看两个地点在地图上的直线距离,然后以此判断要花多少时间走到那里。但实际上,两点之间可能有一条大河阻隔,绕路要花三倍时间;或者有一条捷径让你一下子就到了。直线距离并不等于"走过去需要多少步"。

研究团队用一个叫做Push-T的机器人操控任务做了验证。这个任务里,机器人要把一个T形积木推到指定位置。他们从实验记录里抽出一对一对的状态,测量它们在潜空间里的欧几里得距离,然后对比这两个状态之间实际相差了多少个操作步骤。结果发现,LeWM的潜空间距离和真实的步骤差之间的相关性(斯皮尔曼相关系数)只有0.65——也就是说,这个"距离感"有相当大的误差。更直白地说,潜空间里"看起来很近"的两个状态,在实际操作中可能需要绕很多弯路才能到达。

这个裂缝,就是研究者所说的"训练-规划鸿沟"(train-plan gap):JEPA系统训练时学的是"预测下一步会是什么",但规划时需要的是"哪条路走起来最省力"。这两件事用的是同一套潜空间,但并没有人专门把这个空间调校成适合导航的样子。

香港浸会大学的团队由此提出了一个关键问题:旧日记本身——也就是那些没有奖励信号的示范轨迹数据——里面其实已经藏着时间顺序的信息。日记里第5天到第20天之间走了15天,这本身就告诉你两个地点之间大概需要多少步。能不能从这些纯粹的步骤顺序信息里,挖掘出一套真正适合规划的"进度尺"?

**三、时间距离:从日记里挖出的指南针**

为了解决这个问题,研究团队提出了一个新方法,叫做TD-JEPA(Temporal-Distance JEPA,时间距离联合嵌入预测架构)。这个名字里的"时间距离",就是那把从旧日记里挖出来的指南针。

TD-JEPA的基本骨架和LeWM完全一样:同样的编码器、同样的预测器、同样的防止系统"偷懒"的正则化方法(叫SIGReg)。新东西在于,研究团队在这个骨架上额外装了一个"时间感应器"——一个专门学习"从状态A到状态B需要多少步"的模块。

具体来说,这个时间感应器用了一种叫做度量残差网络(MRN,Metric Residual Network)的结构来定义一种"有方向的距离"。为什么要强调"有方向"?因为现实中的行进往往是不对称的——从山脚走到山顶和从山顶走到山脚,花的力气完全不一样。同样,机器人把积木从A位置推到B位置,和从B推回A,需要的步骤数可能大相径庭。传统的欧几里得距离是对称的(A到B和B到A一样远),但真实的到达代价不是。这个新的距离函数由两部分组成:一部分是对称的,捕捉两个状态的共同特征;另一部分是不对称的,专门描述"从这里到那里"的方向性差异。两部分加起来,得到一个永远非负、而且方向感正确的"前进代价"函数,记作d_ψ。

有了这个函数形式,还需要数据来"校准"它。研究团队的做法非常巧妙:从示范轨迹里取两个时间点i和j(i在前,j在后),它们之间的步数差j-i就是"时间标签",要求d_ψ学会把这对状态的代价估计到接近j-i。与此同时,他们还从不同轨迹里随机抓一些"负样本"——这些来自不同轨迹的状态对之间并没有直接的路径关系,所以它们的代价不应该很低,否则就是系统在"乱说话"。通过一个叫做Smooth L1的平滑损失函数来做回归,加上一个防止负样本代价过低的惩罚项,这套监督信号就让d_ψ真正地"理解"了步骤顺序的含义。

还有第三个新加入的成分:滚动一致性损失(rollout consistency loss)。规划的时候,机器人会在脑子里把未来五步的状态都模拟出来,然后看终点离目标有多远。研究团队发现,如果只训练"下一步预测",多步累积下来的误差会越来越大,就像每走一步都偏了一点点,走了五步以后就完全偏了方向。于是他们专门加了一个训练目标,让系统在模拟五步的时候,每一步的误差都尽量小,把预测的准确性和规划的深度绑在一起。

把这三个成分放到一起,完整的TD-JEPA训练目标就是:原来的一步预测损失,加上五步滚动损失,加上时间距离监督,再加上防坍缩的SIGReg正则化,四项各有权重地加权求和。

**四、两套角色,两种用法**

理解了TD-JEPA的构造之后,还有一个设计选择非常值得关注:学出来的d_ψ并不是在所有任务里都直接用于规划的。研究团队提出了一个"双角色"的设计哲学,并且根据任务的性质来决定用哪种方式。

在以拓扑结构为主的任务里——比如机器人要穿过两个房间找到目标,或者机器人手臂要伸向一个特定位置——"走了多少步"和"到达目标"之间的关系非常直接。在这类任务里,直接用d_ψ作为规划代价,就像真正拿着那把"时间指南针"来导航,效果非常好。

但在以精细接触为主的操控任务里——比如把T形积木精确推到指定角度,或者把一个立方体移到目标位置——"走了多少步"和"任务成功"之间的关系就复杂多了。积木在快要到位的最后几步,需要的是对当前几何姿态的精确感知,而不是"大方向上还有多远"。在这类任务里,研究团队反而选择继续用欧几里得距离作为规划代价,但用的是经过TD-JEPA时间训练之后的那个潜空间,而不是LeWM原始的潜空间。

这就好比说:时间距离训练让这个潜空间的"地图"变得更准确、更有结构,但在需要精细导航的最后阶段,你还是要看地图上的精确坐标而不是走路时间。时间训练的意义,在于让地图本身更好用,而不是强行替换掉所有的导航工具。

**五、实验结果:数字背后的故事**

研究团队在四个不同的任务环境里测试了这套方法,每个任务都代表一类典型的挑战。

第一个是Two-Room(双房间导航),机器人需要从一个房间穿过走廊到达另一个房间的目标位置。这是一个典型的拓扑导航任务。TD-JEPA在这里拿到了100%的成功率,而LeWM是97.4%,另一个叫RC-aux的对比方法是98.6%。虽然差距看起来不大,但这里存在一个有趣的训练动态:如果你追踪训练过程中每个epoch(训练轮次)的成功率,会看到前几轮成绩波动很大,到第五轮只有74%,然后从第六轮开始急速爬升,到第九轮达到100%。这条成长曲线说明,时间距离监督需要一定时间才能让系统真正"悟到"正确的导航方向感。

第二个是Reacher(机械臂伸向任务),机械臂要把末端移到一个随机指定的位置。TD-JEPA达到97%,LeWM是96%,RC-aux是96.8%。这里研究团队还发现了一个有趣的细节:在规划时,如果只看终点状态的代价,效果反而不如把整段轨迹上的平均代价也考虑进去(以0.3的权重混合)。原因在于,时间距离训练让整段路径的进度都有了意义,不只是最后一步。

第三个是Push-T(T形积木推送),这是那个用来说明"直线距离不等于行进步数"问题的任务。在这里,TD-JEPA用的是经过时间训练的潜空间,但规划代价用欧几里得距离,成功率达到86%,比LeWM的83.6%高了约2.4个百分点。

第四个是OGB-Cube(立方体操控),机器人要把一个三维立方体移到指定位置和方向。这是最复杂的操控任务。TD-JEPA在这里取得了最引人注目的提升:82.2%,比LeWM的68%高出了整整14.2个百分点,还略微超过了RC-aux的81.6%。这说明,即便在最后规划时用的是几何距离,经过时间训练的潜空间也能提供质量更高的状态表示,让距离计算更有意义。

从这四个数字来看,TD-JEPA在每个任务上都做到了"不比两个对手差"——这是研究团队设定的核心目标,也是他们最终实现的结果。

**六、拆开看:哪个零件最关键**

为了验证每个设计选择是否真的有用,研究团队做了一系列"拆零件"实验,专门在Push-T任务上测试。

去掉"有方向的残差"那部分,也就是把MRN结构换成一个普通的对称欧几里得投影——成功率从85%附近直接掉到57%附近,是最大的单项损失。这说明仅仅有时间标签的监督还不够,必须配合一个能表达方向性的函数结构,两者缺一不可。

去掉"跨轨迹负样本"那项惩罚——成功率降到77%附近。没有负样本,系统就可能在遇到来自不同轨迹的状态对时,给出莫名其妙的低代价估计,就像导游给你指路时,把你指向了一个完全不相关的目的地,因为他从没见过"错误的目的地"是什么样子。

去掉"五步滚动一致性"训练——成功率降到60%附近,比去掉负样本还要惨。多步预测的精度是规划能力的基础,如果系统在脑子里模拟五步以后误差已经积累得很大,那d_ψ再准确也救不了规划。

总结下来,这三个成分——有方向的代价函数结构、跨轨迹负样本、以及与规划视野对齐的多步一致性——共同构成了TD-JEPA超越基线的核心,缺少任何一个都会有明显的性能下降。

**七、为什么接触任务里时间代价反而不如几何距离**

一个值得深挖的现象是:在Push-T任务里,d_ψ在预测"步数相关性"上明显优于欧几里得距离(斯皮尔曼相关0.91对比0.79),但如果规划时直接用d_ψ,成功率反而只有69%,远低于用欧几里得距离的86%。这是不是矛盾?

研究团队通过记录每个失败案例的"失败位置"找到了答案。他们把每次推积木的过程分成两个阶段:接触前(机器人靠近积木)和接触后(积木被推动、调整角度)。在用d_ψ规划的时候,接触前阶段失败的次数很少,但接触后失败的次数非常多;而用欧几里得距离规划时,接触前几乎不失败,接触后失败次数也大幅减少。

这说明,时间代价d_ψ很擅长引导机器人"大方向上怎么走",但在需要精细调整积木角度的最后阶段,它提供的"进度感"反而会产生误导。研究团队还尝试了一种"接近目标时切换到几何距离"的混合策略,发现这确实比纯d_ψ好,但仍然比直接用几何距离差。根本原因在于,整个CEM规划过程中,几何信息在每一轮候选动作的筛选里都起着作用,不是仅仅在最后几步才需要。这个发现直接支持了研究团队的双角色设计哲学:任务类型决定了应该用哪把尺子来规划。

**八、这套方法在更大图景里处于哪个位置**

研究团队还把TD-JEPA和文献中更广泛的方法做了一个非正式的对比。他们特别指出,这个对比不是严格的头对头测试(因为不同方法用了不同的实验配置),只是一个参考。在这个参考框架里,TD-JEPA在Two-Room和Reacher上达到了文献报告中的最高水平,在OGB-Cube和Push-T上也处于竞争性水准。

相比于"价值引导的JEPA"方法(Value-Guided JEPA),TD-JEPA的最大区别在于:它不需要用强化学习来估计一个"价值函数",只需要轨迹里自带的时间顺序信息。这就像说,你不需要雇一个专门评估"这条路好不好走"的顾问,只需要从旅行日记的日期里自己推算出来。这个特性让TD-JEPA在完全没有奖励信号的离线数据场景下也能工作,适用范围更广。

相比于RC-aux(另一个同期出现的竞争方法),RC-aux的思路是教系统区分"在规划时间范围内能到达的目标"和"最终能到达但现在到不了的目标",但它最终规划时仍然用欧几里得距离。TD-JEPA则直接挖掘了一个可以用于规划的代价函数,思路上更主动、更直接。

说到底,TD-JEPA做的事情,本质上是给旅行者的旧日记本装上了一个"时间感"的解码器。这本日记里的每条记录,都隐含着"走到这里花了多少时间"的信息,而这个信息是判断前进方向最直接的依据——比在地图上量直线距离要靠谱得多。

研究团队证明,对于需要导航的任务,这把从日记里提炼出来的"时间指南针"确实能帮机器人找到更好的路;而对于需要精细操控的任务,这本日记的价值不在于直接用作指南针,而在于让地图本身变得更准确、更有结构,从而让普通的"量距离"方法也能发挥更大的作用。

这项研究揭示的核心道理,可能比它解决的具体问题更有启发意义:训练时学的东西和部署时用的东西,应该从一开始就放在一起设计,而不是训练完了再临时想办法适配。规划需要什么样的"进度感",就应该在训练阶段就把这种进度感的监督信号明确地写进去。当然,这个方法目前还依赖于一个假设:示范轨迹中的时间顺序可以作为"到达代价"的合理替代。当演示轨迹本身有很多迂回、或者不同轨迹之间的可达性差异很大时,这个假设会受到挑战,也是未来值得继续研究的方向。有兴趣深入了解完整细节的读者,可以通过编号arXiv:2607.25337查阅原始论文。

Q&A

Q1:TD-JEPA里的"时间距离"具体是什么意思,和普通的空间距离有什么区别?

A:普通的空间距离(欧几里得距离)就是两个状态在抽象空间里的直线远近,就像量地图上两点的直线距离。时间距离则是"从一个状态出发,按照演示数据里的轨迹,需要走多少步才能到达另一个状态"。TD-JEPA里的d_ψ专门学习这种步数差,而且它是有方向的——从A到B需要的步数,可以和从B到A完全不同,更符合现实中机器人操控任务的实际情况。

Q2:为什么Push-T任务里TD-JEPA的时间代价d_ψ排名准确性更高,实际规划成功率却反而更低?

A:因为"能准确预测步数差"和"适合指导精细操控"是两件不同的事。Push-T任务在积木接近目标位置的最后阶段,需要机器人对当前几何姿态(角度、位置)做精细调整,这时候"还需要多少步"的判断其实会产生误导。欧几里得几何距离在这个阶段能更准确地捕捉"积木现在的姿态离目标有多偏",从而给规划器提供更有效的引导信号。

Q3:RC-aux和TD-JEPA都是在LeWM基础上改进的,它们的核心区别是什么?

A:RC-aux的做法是在训练时加入"预算受限的可达性"监督,让系统学会区分"在规划时间步数内能到达的目标"和"终究能到达但现在还到不了的目标",但规划时仍然用欧几里得距离评分。TD-JEPA的做法是直接从轨迹时间顺序里挖掘一个有方向的代价函数d_ψ,这个代价函数既可以直接用于规划(拓扑任务),也可以通过改善潜空间结构来提升几何规划的质量(操控任务)。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
退休后尽量不要让任何人知道你的状态,尤其是这4件事

退休后尽量不要让任何人知道你的状态,尤其是这4件事

匹夫来搞笑
2026-08-08 03:56:46
《GTA5》演员为《GTA6》试镜60多个角色全遭拒 自嘲像被女友甩了

《GTA5》演员为《GTA6》试镜60多个角色全遭拒 自嘲像被女友甩了

奶凶的小霸王
2026-08-07 00:19:06
消费降级后大家第一个砍的是什么?网友:第一个直接杀死比赛!

消费降级后大家第一个砍的是什么?网友:第一个直接杀死比赛!

夜深爱杂谈
2026-08-03 21:18:54
两性心理学:当一个雄性开始狩猎你时,第一信号不是靠近,也不是言语撩拨,更不是物质供给,他们本能暴露的是这两个企图

两性心理学:当一个雄性开始狩猎你时,第一信号不是靠近,也不是言语撩拨,更不是物质供给,他们本能暴露的是这两个企图

心理观察局
2026-08-08 06:34:13
泸溪河发布“桃酥出现金属牙冠”事件调查结论:消费者已澄清所发视频情况不属实

泸溪河发布“桃酥出现金属牙冠”事件调查结论:消费者已澄清所发视频情况不属实

澎湃新闻
2026-08-07 11:44:03
贝克汉姆14岁的女儿小七怎么如此成熟了,好像少妇

贝克汉姆14岁的女儿小七怎么如此成熟了,好像少妇

西楼知趣杂谈
2026-06-13 19:52:21
第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

蜉蝣说
2026-07-17 09:47:08
越来越多贪官落网,不靠举报,全是数据“出卖”的!

越来越多贪官落网,不靠举报,全是数据“出卖”的!

职场资深秘书
2026-08-07 16:47:50
妹子喝醉误把猫咪塞包里带回家,酒醒后吓坏急联系主人,结果被对方反手直接套牢:你自己养着吧!

妹子喝醉误把猫咪塞包里带回家,酒醒后吓坏急联系主人,结果被对方反手直接套牢:你自己养着吧!

铲屎官阿伟
2026-08-05 14:30:08
手机害得都是穷人家的孩子,因为穷人家的孩子除了手机没什么好玩

手机害得都是穷人家的孩子,因为穷人家的孩子除了手机没什么好玩

户外阿毽
2026-07-26 19:41:47
李炮儿行业冥灯再应验!烹饪大师称号全面取消

李炮儿行业冥灯再应验!烹饪大师称号全面取消

情感大头说说
2026-08-07 08:04:43
小米高管坐进160km/h爆胎的车里被指是AI测试!李肖爽:一镜到底全实拍

小米高管坐进160km/h爆胎的车里被指是AI测试!李肖爽:一镜到底全实拍

快科技
2026-08-07 13:18:06
C罗再度谈及GOAT之争,自认足坛历史最全面球员,多维度得分印证实力

C罗再度谈及GOAT之争,自认足坛历史最全面球员,多维度得分印证实力

体育闲话说
2026-08-08 07:10:15
外部势力步步紧逼,是因为我们丢掉了伟人“只警告一次”的原则吗

外部势力步步紧逼,是因为我们丢掉了伟人“只警告一次”的原则吗

读鬼笔记
2026-08-03 13:42:55
曾经的古装男神郑国霖在景区当NPC,40度高温下穿20斤龙袍

曾经的古装男神郑国霖在景区当NPC,40度高温下穿20斤龙袍

追影客栈
2026-08-07 14:41:13
墙倒众人扶!被人民日报点名的李维刚,再次证明真诚才是必杀技

墙倒众人扶!被人民日报点名的李维刚,再次证明真诚才是必杀技

舊事別提
2026-06-12 07:09:01
期望第二次改革开放

期望第二次改革开放

新浪财经
2026-07-17 23:30:34
中国第一2米36巨人鲍喜顺,坚持生娃不听劝,如今儿子长多高?

中国第一2米36巨人鲍喜顺,坚持生娃不听劝,如今儿子长多高?

至死不渝的爱情
2026-07-26 15:54:15
英国卫星图惊曝西藏13架歼-20竟是辗转四手的2016年旧机,印度30余架阵风加百余苏-30面对这批老货却毫无招架之力

英国卫星图惊曝西藏13架歼-20竟是辗转四手的2016年旧机,印度30余架阵风加百余苏-30面对这批老货却毫无招架之力

林杰论事
2026-08-06 17:54:55
热情好客李刚仁,为前往首尔的马竞队内约80人设宴

热情好客李刚仁,为前往首尔的马竞队内约80人设宴

懂球帝
2026-08-07 18:50:18
2026-08-08 07:43:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9454文章数 567关注度
往期回顾 全部

科技要闻

突然涨价,"只收电费钱"的梁文锋,变了吗

头条要闻

美媒:美副防长"非常执着访华" 想在中国大学发表演讲

头条要闻

美媒:美副防长"非常执着访华" 想在中国大学发表演讲

体育要闻

去年信誓旦旦3000万 今年NBA查无此人

娱乐要闻

周也热恋结束,六个字暴露单身状态

财经要闻

腾讯WorkBuddy领跑AI办公 阿里字节急了?

汽车要闻

越7全球首秀 传祺开始进攻方盒子越野

态度原创

数码
教育
艺术
时尚
公开课

数码要闻

苹果旗舰台式机Mac Pro迎来20周年纪念 淘汰停产已有五个月

教育要闻

不少同学直接放弃交了,说太难了做不出来

艺术要闻

别人画皮他画魂,这个在修道院关了18年的男人,把每一具肉体都画成了圣像

从帆布袋到爱马仕,她们最爱的新包是这些

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版