网易首页 > 网易号 > 正文 申请入驻

时隔十年,AI大牛署名新论文

0
分享至

杰西卡 发自 ROBO-人
量子位ROBO | 公众号 AI4ROBO

自动驾驶领域再出一篇原创研究论文。

这篇最新论文,让自动驾驶能“走一步想十步”,更像老司机了!

最近,任少卿指导发布论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,提出一种新的多模式世界—动作联合模型。

公开学术记录中,他的代表性研究主要集中在2014—2016年,包括Faster R-CNN、ResNet等一系列计算机视觉经典工作。



这一次,他重新以通讯作者身份出现在自动驾驶论文中。论文第一机构为NIO,多位作者来自蔚来,研究方向也直接指向世界模型和规划。

这篇论文要解决的核心问题很明确:同一个驾驶场景下,系统需要处理的不只是一条轨迹,也不只是一个确定的未来。

团队的思路是:让模型一次生成多组场景—动作假设,车辆轨迹与对应的未来场景共同演化,最后再从中选择。

简单来说,自动驾驶不仅能看清周围环境,还能预演多种可能的未来,最终选择最安全的路径执行。

从一条轨迹,扩展到多个未来

端到端自动驾驶的基本逻辑,是将传感器观测直接映射为自车轨迹或控制指令。

World–Action Model则进一步增加了未来场景建模,让规划不仅依据当前环境,也参考动作可能带来的后果。



现有的World–Action Model大致存在两类路线:

一类是级联式方案。例如先生成几条候选轨迹,再分别预测每条轨迹对应的未来场景;或者先预测未来场景,再基于场景完成规划。这种方式可以生成多个候选结果。

但这种方法的问题也很明确:信息按单向传递,后生成的变量无法回头修正前面的决策。

假如模型已经先确定自车向前通过路口,随后才预测到对向车辆没有减速,这个未来结果很难重新参与前面的动作生成过程。

另一类是联合式方案。场景和动作放在同一个生成过程中,两者可以相互影响。

车辆动作变化,预测环境随之调整;环境一旦变化,也会反过来影响车辆轨迹。现有这类方法通常只生成一组场景—动作结果。

论文指出了其中的空白:级联式模型可以覆盖多种驾驶结果,但场景和动作之间缺乏双向交互;联合模型具备双向交互能力,但通常只生成单组结果。



但真实道路往往需要同时处理这两件事。

MM-Future给出的方案是:一次生成多组场景—动作假设,每一组内部的场景和动作继续共同演化。

每一组结果叫做paired scene–action hypothesis(配对场景-动作假设)。

假设模型同时生成几十组候选,其中一组可能是自车加速、对向车辆让行,另一组是自车减速、对向车辆先行,还有其他不同程度的制动、通过方式以及场景变化。

这些结果不再只有轨迹差异,每条轨迹对应的未来环境也各不相同。由此,多种可能的未来进入规划过程。

同时推演几十个未来,需要面临的三道门槛

论文把多模式联合建模的难点拆成了三项:

多样性从哪里产生,多组未来如何控制计算成本,以及生成多个候选后如何筛选。MM-Future的核心设计也是围绕这三个问题展开。

首先是多样性问题。

真实驾驶数据有天然局限,一段录像只记录一种已经发生的结果。司机最终减速,数据中就不会同时留下同一时刻选择加速后的真实场景。模型需要在单结果监督下学出多种合理结果。

MM-Future在动作端根据训练轨迹分布建立了Gaussian Mixture Noise,从不同动作先验出发;场景端则使用独立噪声。

动作与场景的初始状态两两配对,构成了不同驾驶结果的独立起点。

训练时又加入Best-of-Many监督。模型一次生成多组候选,先找出与真实轨迹最接近的一组,再用同一个赢家索引监督动作流和场景流。



这样可以避免所有候选被同一条真值轨迹拉向相似结果,也能保持一条轨迹和它对应的未来场景始终配对。

其次是计算成本。多视角视频如果按每种候选完整展开,模式数量和预测时间一增加,计算量会迅速上升。

作者提出了MM-Tokens,将多摄像头、多时间帧的视觉特征压缩为面向规划的紧凑表示。

MM-Tokens不承担RGB图像重建,也不需要恢复完整BEV。有限的Token预算主要保留与未来演化和驾驶规划相关的信息。

从论文给出的注意力可视化来看,MM-Tokens关注的信息主要集中在道路结构、路口、前车以及周围交通参与者等区域。



模型由此无需为几十种候选分别生成完整的高清未来视频,内部保留的是一组面向规划的紧凑未来场景表征。

第三项是场景与动作如何共同演化,以及多组候选如何筛选。MM-Future使用了modality-aware Transformer同时处理动作流和场景流。

共享注意力负责两类信息的交互,模态专属分支保留两类数据各自的统计特征。

每一组候选共享模型参数,但不同模式之间不交换Token。

因此,动作轨迹会随着配对场景的变化继续更新,场景预测也会根据自车动作重新调整。多轨迹规划由此引入了动作与环境的双向耦合。



生成结束后,Future-Conditioned Proposal Scorer负责完成最后筛选。

它评估一条候选轨迹时,同时读取历史信息和这条轨迹专属的预测未来,再给出分数。每个候选只能读取自己配对的未来,不能借用其他模式的场景结果。

论文还对轨迹和未来Token使用stop-gradient,避免生成器为了提高评分而改变输出分布。

最终推理过程可以压缩成四步:编码历史观测,生成多组场景—动作结果,使用历史与配对未来给候选评分,再输出得分最高的轨迹。

世界模型开始更深层进入规划

MM-Future最终带来了多大提升呢?

论文使用NAVSIM和HUGSIM两套基准进行了测试:

在NAVSIM-v1 navtest上,使用trainval数据训练的MM-Future获得94.0 PDMS。同一张结果表中,WAM方案DriveFuture为90.7,E2E方案DrivoR trainval为93.7。

NAVSIM-v2上,MM-Future获得91.5 EPDMS,高于论文列出的UniTeD 90.1和DriveFuture 89.9。



更能说明方法效果的是消融实验。

只生成动作、仅保留一种模式时,PDMS为84.1;把动作候选增加到32种后提升到92.3。

加入场景—动作联合生成后,单模式为85.1,32模式达到92.9。最后让评分器读取每条轨迹对应的预测未来,PDMS继续提升到93.3。

几组对照分别验证了三个环节:增加模式数量带来主要增益;场景和动作联合生成还能继续提升;配对未来参与候选评分后,规划指标再次改善。



评分器带来的提升在TTC指标上最明显,论文据此认为:候选专属未来主要帮助模型排除交互风险较高的轨迹。

多模式训练还表现出更快的收敛速度。16模式和32模式达到0.80验证PDM分数大约需要3.8k steps,单模式需要17.5k steps。



这个结果说明,多种假设不仅增加了推理分支,在论文设定下也改善了训练效率和最终指标。

不过,多组未来假设也带来了额外的计算成本。

论文主模型一次采样64组场景—动作候选,在单张NVIDIA H800、batch size为1、bf16条件下,端到端前向延迟约为233ms。

16种候选的延迟和单模式方案较为接近,增加到32种后延迟明显提高。候选覆盖范围和计算成本之间仍需要平衡。

闭环测试也存在类似的局限。

MM-Future没有针对HUGSIM继续微调,在436个场景上取得32.3平均HD-Score,高于论文列出的Latent-WAM 28.9和UniAD 28.6。

平均Route Completion为44.5,略低于Latent-WAM的45.9;Extreme难度下HD-Score为8.6,Latent-WAM达到18.1。

论文也主动指出了可解释性问题。MM-Tokens属于隐式场景表征,模型到底保留了哪些规划信息,目前仍难直接观察。

作者计划增加辅助感知模块,把与规划相关的场景结构进一步可视化,以提升模型透明度并辅助故障诊断。



因此,MM-Future目前展示出的价值,更适合放在方法层面理解:

自动驾驶世界模型的角色正在从未来预测进一步走向规划,模型不仅需要估计场景会怎样变化,还要比较不同动作对应的不同场景结果。

更关键的变化发生在多模式的定义上。以往多模式规划主要回答可以走哪几条轨迹,MM-Future把问题扩展到采取不同轨迹后,环境分别可能怎样变化。世界模型开始承担动作后果建模的一部分功能。

这条路线仍处于公开数据集和仿真验证阶段,计算开销、隐式表征、极端场景稳定性都需要继续验证。

论文当前能够支持的结论更明确:在自动驾驶规划中,同时覆盖多种可能结果,并让场景与动作保持双向交互,能够带来稳定的指标增益。

真实道路始终存在多种合理结果。随着世界模型继续进入规划环节,自动驾驶需要处理的对象,也正在从一条候选轨迹,扩展到一组动作与未来的联合结果。

团队介绍

MM-Future背后的研究团队,主要来自蔚来智能驾驶基础模型预研团队。

第一作者Shuai Liu同时署名NIO和中山大学计算机学院。他此前已经在端到端自动驾驶方向有过研究积累,2025年曾以第一作者发表GaussianFusion,尝试用紧凑的高斯表示完成多传感器融合,并被NeurIPS 2025接收。

论文另外几位作者中,Hechangle Gong同时署名NIO和北京航空航天大学,Hao Jiang、Runlin He、Junxiang Zhan、Sheng Yang均署名NIO,Kai Huang来自中山大学。

任少卿担任论文通讯作者,同时署名蔚来和中国科学技术大学AGI研究院。



对于任少卿,大家应该已经很熟悉了——

他是国内自动驾驶深度学习化最关键的那批推手之一,目前为中国科学技术大学讲席教授,中科大官网显示其担任通用人工智能研究所所长;也仍是蔚来智能驾驶业务负责人。

而MM-Future放在蔚来的技术演进里看,也有另一层意义。

2024年,蔚来发布NIO WorldModel和NADArch 2.0,将智能驾驶架构进一步转向世界模型驱动的端到端体系;2025年又加入全闭环强化学习,2026年初最新版NWM开始大规模推送。



蔚来最新披露,截至今年9月,这套基于世界模型和全闭环强化学习的智驾系统已经部署到超过95万辆车。

从NWM到MM-Future,可以看到蔚来世界模型路线的一条演进线索:

先让模型预测未来,再让未来进入规划;从生成多条轨迹,继续走向同时生成多组动作与未来。

论文地址:https://arxiv.org/pdf/2609.20377

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
王楚钦被0比4横扫后,粉丝:这是一场丑陋的胜利!

王楚钦被0比4横扫后,粉丝:这是一场丑陋的胜利!

甜到你心坎
2026-09-29 03:17:00
房价,又回到了“古法”!

房价,又回到了“古法”!

天津365淘房
2026-09-28 16:30:35
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
实习女幼师凌晨点外卖,餐送达后女子收到商家短信:千万不要去拿

实习女幼师凌晨点外卖,餐送达后女子收到商家短信:千万不要去拿

罪案洞察者
2025-09-12 14:41:34
妻子给男人戴88顶绿帽,这大丑闻也敢拍出来

妻子给男人戴88顶绿帽,这大丑闻也敢拍出来

来看美剧
2026-09-29 18:08:45
为啥只有我们在大规模修建高铁?网友:一切为人民服务,不赚钱也要修

为啥只有我们在大规模修建高铁?网友:一切为人民服务,不赚钱也要修

带你感受人间冷暖
2026-09-29 15:27:30
申长雨卸任国家知识产权局局长

申长雨卸任国家知识产权局局长

知产库
2026-09-29 16:43:02
金球奖投票截止!凯恩赔率最热,10月26日伦敦揭晓

金球奖投票截止!凯恩赔率最热,10月26日伦敦揭晓

足球推文C
2026-09-29 15:10:40
反转信号即将来临

反转信号即将来临

西政资本
2026-09-29 09:53:09
一针见血!巴萨 8000 万新援公开开炮!诺坎普门槛远高于英超

一针见血!巴萨 8000 万新援公开开炮!诺坎普门槛远高于英超

澜归序
2026-09-29 08:10:27
何润东成全场唯一手柄玩家:陈赫等众多明星看傻了

何润东成全场唯一手柄玩家:陈赫等众多明星看傻了

游民星空
2026-09-26 19:16:20
锐减30%!9月上海的楼市,开了一个大玩笑!

锐减30%!9月上海的楼市,开了一个大玩笑!

细说职场
2026-09-29 15:58:28
芭莎之夜:戚薇太敢穿,娜扎美的惊心动魄,白鹿身材好顶,李一桐震撼全家

芭莎之夜:戚薇太敢穿,娜扎美的惊心动魄,白鹿身材好顶,李一桐震撼全家

娱乐圈笔娱君
2026-09-28 17:42:29
张本智和看妹妹女双决赛,被曼昱和蒯曼吊打一顿,气的翻白眼!

张本智和看妹妹女双决赛,被曼昱和蒯曼吊打一顿,气的翻白眼!

林子说事
2026-09-29 06:10:48
别克君越第150万辆整车下线 全新君越将于10月10日上市

别克君越第150万辆整车下线 全新君越将于10月10日上市

太平洋汽车
2026-09-29 17:40:08
湖北省荆州市人大常委会原党组书记、主任周昌俊严重违纪违法被开除党籍和公职

湖北省荆州市人大常委会原党组书记、主任周昌俊严重违纪违法被开除党籍和公职

新华社
2026-09-29 17:30:03
新一轮机关事业单位大整顿 , 这6类人员将被清退 , 多地重拳出击!

新一轮机关事业单位大整顿 , 这6类人员将被清退 , 多地重拳出击!

职场资深秘书
2026-09-29 15:11:59
继刘涛高圆圆翻车后,董璇《征途》宋美龄一出,观众直呼选角太差

继刘涛高圆圆翻车后,董璇《征途》宋美龄一出,观众直呼选角太差

陈述影视
2026-09-28 22:28:27
运补失败,油库马上见底!菲律宾电话打向中国:这油到底还送不送

运补失败,油库马上见底!菲律宾电话打向中国:这油到底还送不送

深析古今
2026-09-28 14:54:43
林诗栋夺冠后,离谱事发生不止一件,王楚钦被骂惨,樊振东说对了

林诗栋夺冠后,离谱事发生不止一件,王楚钦被骂惨,樊振东说对了

米果说识
2026-09-29 14:30:16
2026-09-29 18:39:00
智能车参考 incentive-icons
智能车参考
在这里看懂智能车产业变革
1942文章数 3635关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

坚决反对删除"敌国条款" 中国代表两问日方

头条要闻

坚决反对删除"敌国条款" 中国代表两问日方

体育要闻

王楚钦回应:找不回以前打球的感觉

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

京北"小兰博"/限时售9.99万起 北京现代艾尼氪V上市

态度原创

手机
数码
本地
公开课
军事航空

手机要闻

谷歌已开始停用安卓端Google Assistant语音助手,Gemini全面取代

数码要闻

雷克沙推出SLIVER GO microSD UHS-I存储卡,读取可达250MB/s

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗最高领袖最新发声:伊朗现已变得独立、强大

无障碍浏览 进入关怀版