[首发于智驾最前沿微信公众号]2026年,行业共识正在快速形成,世界模型与强化学习的结合,已经成为头部智驾企业技术架构的标准配置。
地平线HSD V2.0以世界模型+端到端强化学习双引擎驱动,将无接管里程提升了56%;
蔚来则在1月全量推送世界模型+闭环强化学习架构后,于6月升级为加入监督微调的三层训练框架;
Momenta R7强化学习世界模型在4月北京车展宣布量产首发,将世界模型与强化学习定义为物理AI的两大核心支柱。
华为ADS 5在4月发布时,云端世界模型也引入了多智能体博弈和在线强化学习,训练强度提升10倍;
小鹏的X-World世界模型支持闭环模拟与在线强化学习,其X-Mind技术框架已嵌入车端;
理想汽车基于VLA、世界模型与强化学习构建的VLA司机大模型,随理想i8在2025年8月交付,并持续迭代闭环强化学习框架;
特斯拉FSD V14也加入了强化学习模块,同时通过3D重建技术将真实行驶数据转化为世界模型训练场景。
几乎每一家主流玩家在发布世界模型时,强化学习都如影随形,这是巧合吗?
01 模仿学习的天花板
过去几年,自动驾驶行业的主流方式是模仿学习,即让AI观看海量人类驾驶数据,学习人在特定场景下如何驾驶。
端到端自动驾驶系统也正是在这个框架下成为主流,它将感知、预测、规划等模块整合到一个神经网络中,直接从传感器输入学习驾驶策略。
![]()
图片源自:网络
这套路线在前几年取得了显著进展,但也存在明显的天花板。
模仿学习的本质是复现人类已有的驾驶行为,AI能学到的不会超出人类驾驶员曾经做过的范围。
这意味着系统很难处理那些人类驾驶员也很少遇到的极端场景。
这些场景在真实道路上出现频率极低,数据采集成本极高,但恰恰是自动驾驶安全性最需要攻克的部分。
此外,模仿学习只能让AI学会像人一样开,但无法让AI学会比人开得更好。
真实驾驶数据中既有好的驾驶行为,也有大量不够好的行为,如果训练目标只是模仿,系统会连人类的缺陷也一起学进去。
而强化学习的介入,恰恰是为了突破这些限制。
02 世界模型 一个可以试错的训练场
世界模型在自动驾驶中的角色,就是一个内部动态模拟器,它可以将传感器看到的东西组织起来,变成系统能够理解和推演未来的内部表征。
世界模型的价值不止于理解当前发生了什么。
小鹏在CVPR 2026上披露的X-Mind技术框架中就明确提出,主动思考、可控生成和长时序推演是优秀世界模型必须具备的三大能力。
这说明世界模型不仅要识别眼前的环境,还要能够预测下一秒、下下一秒可能发生什么。
但问题在于,有了这个可以推演未来的沙盘之后,谁来教系统在里面做出好决策?
![]()
图片源自:网络
传统方法是用人类数据来教,但这又回到了模仿学习的老路。
世界模型生成的海量虚拟场景中,绝大多数情况是人类驾驶员从未经历过的,既然没有人类示范,模仿学习就无从下手,此时强化学习的优势就体现了出来。
强化学习的训练逻辑和模仿学习完全不同。
它不要求AI去模仿谁,而是给AI设定一个如安全、高效地完成驾驶任务这样的目标,然后让AI在一个环境里自己尝试、获得反馈、逐步优化自己的行为。
世界模型恰好提供了这个环境,即一个可以无限次试错、成本极低、且能覆盖各种极端场景的虚拟物理世界。
两者结合的技术路径在学术和工业界都有清晰的落地。
香港大学李弘扬团队联合华为发布的World Engine,将真实驾驶失败场景转化为可闭环交互的仿真世界,并利用强化学习对端到端模型进行针对性训练,在华为ADS的闭环验证中让碰撞事件降低了45.5%。
这个框架的技术核心包括基于3DGS的场景重建、扩散模型泛化生成多样化交通场景,以及通过行为约束的强化学习提升长尾安全表现。
03 强化学习解决的不仅是怎么开 更是开得好不好
世界模型提供了在哪里练,强化学习提供了怎么练,两者结合更是重新定义了好的标准。
在模仿学习框架下,好的定义是像人。而在强化学习框架下,好的定义由奖励函数直接给出。
自动驾驶的奖励函数需要同时兼顾碰撞避免、可行驶区域合规、行程进度、碰撞时间裕度和乘坐舒适性等多个维度。
这意味着系统可以在这些目标之间寻找最优平衡,而不只是复现人类的驾驶行为。
这个区别带来的实际效果也相当显著。
地平线HSD V2.0的数据显示,引入世界模型+端到端强化学习后,无接管里程提升了56%,复杂场景下的博弈能力提升了167%,系统反应速度提升了20%。
![]()
图片源自:网络
在CVPR 2026上,AD-R1(由澳门大学、理想汽车等机构联合提出的前沿框架)中也提出了一个观点。
传统世界模型在训练时只见过安全驾驶数据,当输入一个不安全轨迹时,模型会幻想出一个不切实际的安全未来。这种无法想象失败的能力使它们无法成为可靠的策略评估工具。
AD-R1的解决方案是通过反事实合成管道,系统性地生成符合逻辑的碰撞和偏离道路事件,让世界模型学会对危险说实话。
然后将这个公正世界模型集成到闭环强化学习框架中,作为内部评判器来优化驾驶策略。
WorldRFT(由中国科学院自动化研究所、中国科学院大学与理想汽车联合提出的前沿自动驾驶规划框架)则从另一个角度切入。
其提出了面向规划的潜空间世界模型框架,通过层次化规划分解和局部感知交互优化机制来对齐场景表征学习与规划任务,并引入强化学习微调来增强安全关键的策略性能。
在nuScenes基准上,它将碰撞率从0.30%降至0.05%,降幅达83%。
CoPhy框架(由清华大学与理想汽车联合提出的前沿自动驾驶框架)的思路也很有代表性。
其构建一个自回归的BEV世界模型,显式预测以候选动作为条件的未来语义地图,作为一个可解释的物理沙盘,从中直接推导安全指标。
然后通过GRPO优化驾驶策略,采用双重奖励机制:从BEV推演中导出的物理奖励强制执行硬安全约束,来自语言对齐评分器的认知奖励确保意图合规。
这些学术成果其实都有一个共同特征,那就是世界模型不再只是生成看起来像真的视频,而是成为一个能够评估行动后果、区分好坏决策的评判系统。
而强化学习正是利用这个评判系统来持续优化策略的核心机制。
04 行业正在从预训练走向后训练?
2026年自动驾驶行业的趋势也在转向,自动驾驶的训练范式正在经历从更大规模预训练到更高价值后训练的方向转变。
Waymo在CVPR 2026上披露的世界模型训练框架清晰地展示了预训练→中期训练→后训练这一思路。
它先在Google DeepMind的Genie 3通用世界模型基础上获得对世界规律的理解,然后通过海量自动驾驶数据进行中期训练,让模型建立对驾驶场景的认知,最后针对具体驾驶任务进行微调和蒸馏。
蔚来的实践也印证了这个趋势,2026年1月,蔚来在行业内首次完整应用强化学习并实现大规模跑通。
到6月的新版本,架构也从世界模型+闭环强化学习升级为世界模型+监督微调+闭环强化学习三层训练框架。
新增的监督微调利用好行为数据进行精细行为雕刻,让模型学习类人表现,而强化学习则负责拉高能力上限。
世界模型与强化学习的结合,本质上是让自动驾驶系统从被动响应升级为主动预判。
传统端到端模型通过感知输入直出轨迹,实现的是直觉式反应;而世界模型的能力则更进一步,它能理解物理规律和因果关系。
强化学习则在这个理解的基础上,让系统通过自主试错找到最优策略。
![]()
图片源自:网络
CIC灼识咨询预测,城市NOA解决方案渗透率预计将从2025年的11%飙升至2030年的62%。
在这个规模化扩张的过程中,规则驱动的方法将越来越难以应对场景的多样性和复杂度。
世界模型提供对物理世界的理解能力,强化学习提供自主优化的能力,两者结合,正在成为支撑高阶智驾规模化部署的技术底座。
当然,这条路线也有待解决的问题。
世界模型在复杂长尾场景下的泛化能力仍需大规模路测验证,端到端方案的可解释性短板尚未根本解决。
但自动驾驶行业未来的发展方向已经清晰,在物理AI的时代,让机器自己学会理解世界、并在理解中学会更好地行动,已成产业共识。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.