网易首页 > 网易号 > 正文 申请入驻

为什么自动驾驶的世界模型中都会使用强化学习?

0
分享至

[首发于智驾最前沿微信公众号]2026年,行业共识正在快速形成,世界模型与强化学习的结合,已经成为头部智驾企业技术架构的标准配置。

地平线HSD V2.0以世界模型+端到端强化学习双引擎驱动,将无接管里程提升了56%;

蔚来则在1月全量推送世界模型+闭环强化学习架构后,于6月升级为加入监督微调的三层训练框架;

Momenta R7强化学习世界模型在4月北京车展宣布量产首发,将世界模型与强化学习定义为物理AI的两大核心支柱。

华为ADS 5在4月发布时,云端世界模型也引入了多智能体博弈和在线强化学习,训练强度提升10倍;

小鹏的X-World世界模型支持闭环模拟与在线强化学习,其X-Mind技术框架已嵌入车端;

理想汽车基于VLA、世界模型与强化学习构建的VLA司机大模型,随理想i8在2025年8月交付,并持续迭代闭环强化学习框架;

特斯拉FSD V14也加入了强化学习模块,同时通过3D重建技术将真实行驶数据转化为世界模型训练场景。

几乎每一家主流玩家在发布世界模型时,强化学习都如影随形,这是巧合吗?

01 模仿学习的天花板

过去几年,自动驾驶行业的主流方式是模仿学习,即让AI观看海量人类驾驶数据,学习人在特定场景下如何驾驶。

端到端自动驾驶系统也正是在这个框架下成为主流,它将感知、预测、规划等模块整合到一个神经网络中,直接从传感器输入学习驾驶策略。



图片源自:网络

这套路线在前几年取得了显著进展,但也存在明显的天花板。

模仿学习的本质是复现人类已有的驾驶行为,AI能学到的不会超出人类驾驶员曾经做过的范围。

这意味着系统很难处理那些人类驾驶员也很少遇到的极端场景。

这些场景在真实道路上出现频率极低,数据采集成本极高,但恰恰是自动驾驶安全性最需要攻克的部分。

此外,模仿学习只能让AI学会像人一样开,但无法让AI学会比人开得更好。

真实驾驶数据中既有好的驾驶行为,也有大量不够好的行为,如果训练目标只是模仿,系统会连人类的缺陷也一起学进去。

而强化学习的介入,恰恰是为了突破这些限制。

02 世界模型 一个可以试错的训练场

世界模型在自动驾驶中的角色,就是一个内部动态模拟器,它可以将传感器看到的东西组织起来,变成系统能够理解和推演未来的内部表征。

世界模型的价值不止于理解当前发生了什么。

小鹏在CVPR 2026上披露的X-Mind技术框架中就明确提出,主动思考、可控生成和长时序推演是优秀世界模型必须具备的三大能力。

这说明世界模型不仅要识别眼前的环境,还要能够预测下一秒、下下一秒可能发生什么。

但问题在于,有了这个可以推演未来的沙盘之后,谁来教系统在里面做出好决策?



图片源自:网络

传统方法是用人类数据来教,但这又回到了模仿学习的老路。

世界模型生成的海量虚拟场景中,绝大多数情况是人类驾驶员从未经历过的,既然没有人类示范,模仿学习就无从下手,此时强化学习的优势就体现了出来。

强化学习的训练逻辑和模仿学习完全不同。

它不要求AI去模仿谁,而是给AI设定一个如安全、高效地完成驾驶任务这样的目标,然后让AI在一个环境里自己尝试、获得反馈、逐步优化自己的行为。

世界模型恰好提供了这个环境,即一个可以无限次试错、成本极低、且能覆盖各种极端场景的虚拟物理世界。

两者结合的技术路径在学术和工业界都有清晰的落地。

香港大学李弘扬团队联合华为发布的World Engine,将真实驾驶失败场景转化为可闭环交互的仿真世界,并利用强化学习对端到端模型进行针对性训练,在华为ADS的闭环验证中让碰撞事件降低了45.5%。

这个框架的技术核心包括基于3DGS的场景重建、扩散模型泛化生成多样化交通场景,以及通过行为约束的强化学习提升长尾安全表现。

03 强化学习解决的不仅是怎么开 更是开得好不好

世界模型提供了在哪里练,强化学习提供了怎么练,两者结合更是重新定义了好的标准。

在模仿学习框架下,好的定义是像人。而在强化学习框架下,好的定义由奖励函数直接给出。

自动驾驶的奖励函数需要同时兼顾碰撞避免、可行驶区域合规、行程进度、碰撞时间裕度和乘坐舒适性等多个维度。

这意味着系统可以在这些目标之间寻找最优平衡,而不只是复现人类的驾驶行为。

这个区别带来的实际效果也相当显著。

地平线HSD V2.0的数据显示,引入世界模型+端到端强化学习后,无接管里程提升了56%,复杂场景下的博弈能力提升了167%,系统反应速度提升了20%。



图片源自:网络

在CVPR 2026上,AD-R1(由澳门大学、理想汽车等机构联合提出的前沿框架)中也提出了一个观点。

传统世界模型在训练时只见过安全驾驶数据,当输入一个不安全轨迹时,模型会幻想出一个不切实际的安全未来。这种无法想象失败的能力使它们无法成为可靠的策略评估工具。

AD-R1的解决方案是通过反事实合成管道,系统性地生成符合逻辑的碰撞和偏离道路事件,让世界模型学会对危险说实话。

然后将这个公正世界模型集成到闭环强化学习框架中,作为内部评判器来优化驾驶策略。

WorldRFT(由中国科学院自动化研究所、中国科学院大学与理想汽车联合提出的前沿自动驾驶规划框架)则从另一个角度切入。

其提出了面向规划的潜空间世界模型框架,通过层次化规划分解和局部感知交互优化机制来对齐场景表征学习与规划任务,并引入强化学习微调来增强安全关键的策略性能。

在nuScenes基准上,它将碰撞率从0.30%降至0.05%,降幅达83%。

CoPhy框架(由清华大学与理想汽车联合提出的前沿自动驾驶框架)的思路也很有代表性。

其构建一个自回归的BEV世界模型,显式预测以候选动作为条件的未来语义地图,作为一个可解释的物理沙盘,从中直接推导安全指标。

然后通过GRPO优化驾驶策略,采用双重奖励机制:从BEV推演中导出的物理奖励强制执行硬安全约束,来自语言对齐评分器的认知奖励确保意图合规。

这些学术成果其实都有一个共同特征,那就是世界模型不再只是生成看起来像真的视频,而是成为一个能够评估行动后果、区分好坏决策的评判系统。

而强化学习正是利用这个评判系统来持续优化策略的核心机制。

04 行业正在从预训练走向后训练?

2026年自动驾驶行业的趋势也在转向,自动驾驶的训练范式正在经历从更大规模预训练到更高价值后训练的方向转变。

Waymo在CVPR 2026上披露的世界模型训练框架清晰地展示了预训练→中期训练→后训练这一思路。

它先在Google DeepMind的Genie 3通用世界模型基础上获得对世界规律的理解,然后通过海量自动驾驶数据进行中期训练,让模型建立对驾驶场景的认知,最后针对具体驾驶任务进行微调和蒸馏。

蔚来的实践也印证了这个趋势,2026年1月,蔚来在行业内首次完整应用强化学习并实现大规模跑通。

到6月的新版本,架构也从世界模型+闭环强化学习升级为世界模型+监督微调+闭环强化学习三层训练框架。

新增的监督微调利用好行为数据进行精细行为雕刻,让模型学习类人表现,而强化学习则负责拉高能力上限。

世界模型与强化学习的结合,本质上是让自动驾驶系统从被动响应升级为主动预判。

传统端到端模型通过感知输入直出轨迹,实现的是直觉式反应;而世界模型的能力则更进一步,它能理解物理规律和因果关系。

强化学习则在这个理解的基础上,让系统通过自主试错找到最优策略。



图片源自:网络

CIC灼识咨询预测,城市NOA解决方案渗透率预计将从2025年的11%飙升至2030年的62%。

在这个规模化扩张的过程中,规则驱动的方法将越来越难以应对场景的多样性和复杂度。

世界模型提供对物理世界的理解能力,强化学习提供自主优化的能力,两者结合,正在成为支撑高阶智驾规模化部署的技术底座。

当然,这条路线也有待解决的问题。

世界模型在复杂长尾场景下的泛化能力仍需大规模路测验证,端到端方案的可解释性短板尚未根本解决。

但自动驾驶行业未来的发展方向已经清晰,在物理AI的时代,让机器自己学会理解世界、并在理解中学会更好地行动,已成产业共识。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
特朗普:如果共和党输掉中期选举,自己将被弹劾;重申必须阻止伊朗发展核武器,“霍尔木兹海峡现在是美国的领土,它就是美国的领土”

特朗普:如果共和党输掉中期选举,自己将被弹劾;重申必须阻止伊朗发展核武器,“霍尔木兹海峡现在是美国的领土,它就是美国的领土”

鲁中晨报
2026-08-22 09:14:01
人民日报发声:机关事业单位的隐性收入,正在消失

人民日报发声:机关事业单位的隐性收入,正在消失

细说职场
2026-08-20 19:07:19
深圳一男子因不满其他车辆变道影响自己,恶意别车致三车连撞被行拘,交警:构成寻衅滋事,责令全额赔付

深圳一男子因不满其他车辆变道影响自己,恶意别车致三车连撞被行拘,交警:构成寻衅滋事,责令全额赔付

潇湘晨报
2026-08-22 19:44:07
这两个强国,真到了战争的边缘

这两个强国,真到了战争的边缘

牛弹琴
2026-08-22 08:31:12
国防部下通牒,解放军拖船已到位!美国航母跑路,菲律宾这回惨了

国防部下通牒,解放军拖船已到位!美国航母跑路,菲律宾这回惨了

健身狂人
2026-08-21 12:15:17
朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

人生录
2026-08-13 00:05:10
小学生作文《热死了》走红,老师看后直接给满分:我拜你为师吧!

小学生作文《热死了》走红,老师看后直接给满分:我拜你为师吧!

谭老师地理大课堂
2026-08-13 01:17:31
许家印10年砸170亿元打造恒大队!李玮锋:他让我在合同上填年薪

许家印10年砸170亿元打造恒大队!李玮锋:他让我在合同上填年薪

风过乡
2026-08-21 18:11:55
明日花绮罗:13年业界顶流,累积200+作品,隐退后凭风波再出圈

明日花绮罗:13年业界顶流,累积200+作品,隐退后凭风波再出圈

吃瓜党二号头目
2026-08-22 13:09:18
国安12场不败!落后蓉城12分,5战玉昆不败,连刷5大纪录

国安12场不败!落后蓉城12分,5战玉昆不败,连刷5大纪录

奥拜尔
2026-08-22 22:03:22
潘展乐47秒91夺冠 波波维奇欧锦赛46秒56距世界纪录仅差0.16秒

潘展乐47秒91夺冠 波波维奇欧锦赛46秒56距世界纪录仅差0.16秒

林子说事
2026-08-22 14:50:26
极氪9X拿下50万以上车型销量第一名 官方公布车主画像

极氪9X拿下50万以上车型销量第一名 官方公布车主画像

CNMO科技
2026-08-21 15:24:08
胡锡进要求道歉后,媒体也报道了北大张丹丹教授

胡锡进要求道歉后,媒体也报道了北大张丹丹教授

新动察
2026-08-22 20:17:51
蒙古女网红带多人强闯中资企业石油勘探营地,不但破坏财物,还侮辱中方员工

蒙古女网红带多人强闯中资企业石油勘探营地,不但破坏财物,还侮辱中方员工

西楼知趣杂谈
2026-08-22 17:22:54
重大资产重组!A股公司公告,彻底清仓!

重大资产重组!A股公司公告,彻底清仓!

券商中国
2026-08-22 10:39:14
韩红风波后近况曝光!疑似为基金会跑业务,似乎胖了不少,单手插兜霸气依旧

韩红风波后近况曝光!疑似为基金会跑业务,似乎胖了不少,单手插兜霸气依旧

小徐讲八卦
2026-08-21 07:53:05
美网奖金创历史!1.08亿美元+冠军550万,郑钦文连赢3场才拿14万,这个数字直接把网球历史翻了一页,成为第一个奖金破亿的大满贯赛事

美网奖金创历史!1.08亿美元+冠军550万,郑钦文连赢3场才拿14万,这个数字直接把网球历史翻了一页,成为第一个奖金破亿的大满贯赛事

锁上的光v
2026-08-21 17:44:45
宝马X5与奔驰GLE哪个更耐开?修车师傅:跑个7年差别就出来了

宝马X5与奔驰GLE哪个更耐开?修车师傅:跑个7年差别就出来了

刘哥谈体育
2026-08-22 15:23:51
普高率80%的甜蜜陷阱——在武汉,就算进了重点高中,普通班一个班也难出几个985

普高率80%的甜蜜陷阱——在武汉,就算进了重点高中,普通班一个班也难出几个985

手工制作阿爱
2026-08-22 16:54:51
赵世勇、张忠当选中央纪委副书记

赵世勇、张忠当选中央纪委副书记

上观新闻
2026-08-22 15:26:41
2026-08-22 23:16:49
智驾最前沿
智驾最前沿
自动驾驶领域专业的技术、资讯分享平台。我们的slogan是:聚焦智能驾驶 ,紧盯行业前沿。
551文章数 11关注度
往期回顾 全部

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

头条要闻

俄美均对联大主席贝尔伯克强烈不满 指责其行为"越界"

头条要闻

俄美均对联大主席贝尔伯克强烈不满 指责其行为"越界"

体育要闻

字母+汤神,有没有搞头?

娱乐要闻

《空枪》预测票房缩水,手握王炸都没赢

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

最能代表东方神韵的新旗舰 体验面子里子都拉满的比亚迪大汉

态度原创

亲子
游戏
本地
数码
公开课

亲子要闻

天天吵着要玩水去,玩水去,这回安排上了

FS社新作被批素材复用严重!像《血源》和黑环

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

数码要闻

当贝推出RX10投影仪:0.33" DMD显示芯片、1200CVIA,5499元

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版