网易首页 > 网易号 > 正文 申请入驻

自动驾驶正从软件定义转向AI定义?

0
分享至

[首发于智驾最前沿微信公众号]2026年6月,全球计算机视觉顶会CVPR在美国丹佛开幕,特斯拉AI软件副总裁Ashok Elluswamy在大会上正式披露,FSD V14采用单一端到端神经网络,推理频率达36赫兹,远高于行业主流的10赫兹水平。小鹏汽车第三次受邀登台,完整展示了世界模型技术图谱,其中包含X-World、X-Foresight、X-Cache三大核心技术,构建VLA+世界模型双支柱物理AI架构。从这些技术架构来看,自动驾驶行业正在经历从软件定义到AI定义的技术转变。

01

软件定义解决了什么问题?又留下了什么问题?

软件定义汽车主要解决了软硬件解耦的问题,传统汽车的功能在出厂时就被固化,后续无法改变,而软件定义让汽车可以通过OTA升级持续获得新功能,像智能手机一样不断迭代。但软件定义的局限同样明显,它的所有功能迭代都局限于预设程序和固定规则框架内,属于被动式、标准化的功能更新。

在软件定义汽车时代,工程师会将看到行人十米内要刹车、前方有锥桶要变道这样的指令一条条写进代码。这套做法看似补全了系统漏洞,但现实世界的驾驶场景几乎无穷无尽,工程师永远写不完所有规则。更关键的是,软件定义解决的是可迭代的问题,而不是会思考的问题。可迭代和会思考这两者的差别,一个是让车能不断安装新功能,一个是让车能自己判断该做什么。



图片源自:网络

特斯拉的FSD从V11过渡到V12时,就经历了一次关键转变,其用经过数百万个视频片段训练的端到端神经网络,取代了V11控制堆栈中超过30万行用于城市街道驾驶的C++代码。但V12时代并未实现零代码,系统仍保留约2000行C++代码,主要负责系统调度等非核心控制逻辑,这次转型也证明了数据驱动的神经网络在复杂驾驶决策上能够超越手工规则编码,为后续彻底的全链路AI化铺平了道路。

到了V14.2及更早版本,即便感知与规划模块已大量采用神经网络技术,但最核心的车辆底层控制(包括转向角度、油门与刹车力度调节)依然依赖工程师手写的C++代码,这就导致车辆行驶表现生硬,在遇到黄灯时会突兀急刹、遇到停车标识反复制动。之所以会出现这个问题,是因为代码只能覆盖工程师提前想好的那部分场景,脱离规则之外的部分就成了系统的能力盲区。

2026年4月,特斯拉开始推送FSD V14.3。这次更新将控制环节的手写C++代码全部移除了,改由神经网络直接输出驾驶指令。系统从车载摄像头接收图像,到最终的方向盘和踏板指令,中间不再经过任何手写规则的约束,而这就是全域一段式端到端架构。从V12的大部分端到端到V14.3的全域端到端,特斯拉花了两年时间才把最后的代码从控制链路中拿掉。



图片源自:网络

02

端到端,从规则驱动到数据驱动?

端到端神经网络是AI定义汽车的第一个技术突破口。

所谓端到端,就是通过一个AI模型,输入原始传感器数据就可以输出最终控制指令。传统的模块化架构把感知、规划、控制拆成独立模块,每个模块用不同的算法,模块之间通过人工定义的接口传递信息;端到端则用一个神经网络覆盖从传感器输入到控制输出的全过程。这两种架构的本质区别在于,模块化是工程师写规则告诉系统怎么做,端到端是系统从数据中自己学会怎么做。

端到端最大的优势就是泛化能力,传统规则系统在没见过的新场景中容易出错,端到端模型学习的则是从传感器输入到驾驶决策的整体映射关系,能在陌生场景中做出相对合理的反应。FSD V14在城市复杂路况下的平均接管间隔已降至每1000英里仅0.3次,安全性约为美国普通人类驾驶员的8倍。



图片源自:网络

特斯拉就在V14.3中做了几项关键的技术改进,模型参数量提升到此前版本的约10倍,能记住更多样的路况模式,其中包括异形交叉口、复合信号灯、复杂的施工区布局、非标准化的交通标志等边缘案例。系统还第一次加入了明确的时空记忆能力,时长约3到5秒。它不再是一个健忘的AI,能记住前几秒谁突然切入了车道,并基于此推演未来3到5秒的人车轨迹。

编译器层面特斯拉也做了改动,特斯拉基于MLIR(多层中间表示)框架从零重写了AI编译器和运行环境,可以在较高抽象层次上保留计算图的结构信息,更容易识别出哪些运算可以合并、哪些数据可以被复用,可生成更精简的硬件指令序列。这样改动的结果是系统从摄像头捕捉到画面到车辆执行动作的时间延迟比之前缩短了20%。在时速80公里的紧急避险中,这意味着一米多的刹车距离。

CVPR 2026上,特斯拉进一步披露了FSD V14的更多技术细节。系统引入了三个“心理评分”维度:舒适度评分、干预可能性评分、人类模仿判别器评分,使车辆能够自主评估拟执行动作的拟人化程度。特斯拉还在深入应用世界模型技术,通过专利将真实车辆摄像头画面重建为3D“骨架”模型,生成近乎无限的训练场景。

但端到端并不是没有问题,一个巨型模型直接吃进传感器数据输出驾驶指令,就像一个黑盒子,你不知道它某个急刹到底是看到了真正的危险还是看错了影子。可解释性差、安全验证困难,这也是监管部门审批L3以上自动驾驶时面临的核心障碍。

03

VLA与世界模型,从感知到理解

端到端之后,行业的技术变革并没有停下来,VLA(视觉-语言-动作)模型和世界模型成为了新的技术高地。

VLA是在视觉-语言模型的基础上引入动作token,让模型能够从视觉、语言与机器人轨迹数据的配对中联合学习,VLA融合了视觉、语言、动作三大模块,模型参数量庞大,推理计算量远超传统端到端算法。

理想汽车的马赫VLA系统就是VLA路线在国内的代表,这套系统被定义为一套从感知、计算、决策到执行全部打通的具身智能系统。马赫VLA大模型是具身智能的大脑,3D ViT感知模型是眼睛,马赫M100芯片是心脏,星环OS则是神经系统,全线控底盘则是手脚。



图片源自:网络

3D ViT作为纯视觉方案,能输出类似全彩点云的丰富表征,其中包括RGB信息、纹理特征、动静分离等,近处深度精度接近激光雷达;马赫VLA 2.1版本多模态计算性能较前代提升十倍,深度融合了激光雷达与视觉数据,有效视距提升50%。系统通过全链路优化,将紧急情况下的反应时间缩短至0.28秒,比普通人类驾驶员快约40%。此外,系统视觉的输入时延也降低了47%,模型推理时延降低43%,底盘响应降低38%,操作系统调度降低28%,整体端到端时延降低40%。理想计划在2026年第三季度向用户推送全新马赫VLA版本,第四季度整体智驾能力对标特斯拉FSD V14。

小鹏则走的是另一条路,其采用了VLA与世界模型双支柱路线,小鹏通用智能中心负责人刘先明在CVPR 2026上明确回应了行业长期争论的路线问题,VLA与世界模型并非相互竞争。在小鹏架构中,第二代VLA从人类驾驶行为中学习如何行动,世界模型则通过对未来状态的预测学习行动之后世界会如何变化,两者共同构成物理世界基座模型。前者让模型学习如何行动,后者让模型理解行动之后世界会如何变化。

小鹏的第二代VLA拥有数十亿参数量,其使用上亿视频片段训练,每版模型训练量超4万亿Token,车端推理速度提升12倍。实测数据显示,VLA 2.0可使重刹次数减少99%、顿挫减少89%,复杂路况通行效率比肩人类驾驶员。推送首月用户辅助驾驶里程占比就突破50%,成为行业首个达成该数据的系统。



图片源自:网络

在世界模型方面,小鹏则披露了主动思考、可控生成和长时序推演三大核心能力,对应的技术成果包括X-Mind(主动推理与决策可解释性)、X-World(可控多视角生成式世界模型)、X-Foresight(视觉-动作因果预测网络)以及X-Cache(推理加速方案)。

X-World能在给定动作条件下生成符合物理约束的未来视频,在持续生成过程中保持良好的可控性与稳定性。世界模型借鉴了大语言模型中下一个Token预测的范式,通过在海量未标注视频上进行下一帧或下一状态的密集预测,逐步学会物理世界的动力学与因果结构。小鹏依托万卡级智算集群,单GPU训练效率一年间提升1010%,GPU硬件利用率从40%提升至90%。

Waymo在CVPR 2026上也首次曝光了自家的世界模型,Waymo没有选择从零训练,而是直接利用Google DeepMind的Genie 3作为基础模型,Genie 3作为一个能理解现实世界运行规律的世界模拟器,加入了Waymo专属传感器数据(多摄像头、激光雷达、毫米波雷达、高精地图)进行中期训练,最后针对具体驾驶任务进行微调和蒸馏。

该模型可预测其他车辆、行人的行为意图以及交通信号的变化等道路场景的动态演化,使系统具备预判能力。业内将这一方向比喻为自动驾驶的Genie时代,系统不再被动感知,而是主动理解和预测世界。英伟达也发布了Cosmos 3,被描述为全球首个统一视觉推理、世界生成与动作生成的物理AI全基座模型。

从规则式到端到端,再到VLA和世界模型,技术演进的方向越来越清晰,自动驾驶系统正在从执行指令走向理解世界。

04

算力架构的重构:从TOPS到带宽

AI定义汽车时代,对底层基础设施也提出了完全不同的要求。

麦肯锡在2026年6月发布的一篇报告中指出,自动驾驶正在从一个汽车工程问题变成一个AI基础设施问题,端到端架构带来的算力需求爆炸,直接将芯片从汽车的一个零部件推成了决定竞争力的核心变量。在ADAS和自动驾驶处理半导体的全球市场上,2025年约为76亿美元,到2035年将超过460亿美元,年复合增长率将达24%左右。

回看这两年的技术发布会,当进入大模型时代后,各家车企一直在拼TOPS,但端到端时代的真正瓶颈并不是计算能力,而是内存带宽。端到端模型参数量巨大,传感器数据流高分辨率、多模态、高帧率,中间的激活层数据体积远超模型本身,系统在算力耗尽之前带宽已经先被堵死。高带宽LPDDR内存、更大的片上SRAM缓存甚至HBM,正在取代TOPS数成为衡量下一代ADAS芯片的硬指标。

此外,芯片架构本身也在变化,传统冯·诺依曼架构以顺序指令驱动计算,会用大量晶体管处理缓存、调度、分支预测等管理开销。而在AI计算任务中,传统架构的效率瓶颈会被进一步放大。

理想的应对方案是采用数据流架构,AI计算天然是并行的,数据是张量,关系是确定的,流动路径是清晰的,数据流动驱动计算发生,而不是中央指令队列主导计算。

理想自研的马赫M100 Ultra采用5nm车规级工艺,单芯片算力达1280TOPS,在芯片内部,理想将超过一半晶圆面积给到神经网络处理器,NPU部分由56个计算单元和1个数据处理模块构成,内存系统采用8路LPDDR5X子系统,片外内存带宽达到273GB/s。更关键的是,因为数据流架构设计,实际算力利用率超过82%。在运行端到端模型期间,系统延迟可缩减40%,降至200至300毫秒区间。

比亚迪发布的4nm制程智驾芯片璇玑A3,配备3核NPU,原生支持Transformer大模型,DDR带宽273GB/s,通过三颗芯片协同实现了超2100TOPS总算力。NPU正在取代GPU成为端到端芯片的主力,CPU则转向做安全冗余和系统调度。

05

最后的话

其实现阶段,自动驾驶技术演进的方向越来越清晰,汽车正在从可升级的工具变成能思考的智能体。其实这个转变刚刚开始,但其影响正在快速扩散到芯片、算法、数据乃至整个产业格局,谁能在AI定义的赛道上建立起真正的技术壁垒,谁就能在下一阶段的竞争中占据主动。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
24岁女孩称做正颌手术反成“鞋拔子脸”,后退2毫米变前移13毫米,恢复至少要花30万;医生表示自己喜欢这种面型,比之前洋气,卫健委介入

24岁女孩称做正颌手术反成“鞋拔子脸”,后退2毫米变前移13毫米,恢复至少要花30万;医生表示自己喜欢这种面型,比之前洋气,卫健委介入

扬子晚报
2026-07-26 10:56:54
女子进店就要买300克黄金,店主却发现一个反常细节……

女子进店就要买300克黄金,店主却发现一个反常细节……

环球网资讯
2026-07-25 21:41:12
把插队的中国游客骂为蟑螂不算冤枉

把插队的中国游客骂为蟑螂不算冤枉

廖保平
2026-07-25 09:05:59
DNA揭开隔代血缘真相:孙子最亲的其实不是爷爷奶奶

DNA揭开隔代血缘真相:孙子最亲的其实不是爷爷奶奶

粤语音乐喷泉
2026-07-25 15:16:01
第26轮猛攻打响!伊朗万弹齐发,美特种部队被一锅端,防线已告急

第26轮猛攻打响!伊朗万弹齐发,美特种部队被一锅端,防线已告急

梦史
2026-07-26 07:10:03
山西运城路面塌陷处现大量白骨,系1500年前玉壁之战遗骸,这场古战争有多惨烈?这些白骨该如何处理?

山西运城路面塌陷处现大量白骨,系1500年前玉壁之战遗骸,这场古战争有多惨烈?这些白骨该如何处理?

贵重物品爱美食
2026-07-25 16:49:47
李丽珍被偶遇近况曝光,上半身干瘪严重,嘴角下垂太显老态

李丽珍被偶遇近况曝光,上半身干瘪严重,嘴角下垂太显老态

两只米老鼠
2026-07-25 13:24:45
中央考核巡查组,向地方反馈明查暗访情况

中央考核巡查组,向地方反馈明查暗访情况

政知新媒体
2026-07-25 19:12:23
阿根廷足协正式发声:请接受西班牙世界杯夺冠,超10万人请愿重赛不予认可

阿根廷足协正式发声:请接受西班牙世界杯夺冠,超10万人请愿重赛不予认可

日常碎碎念啊
2026-07-26 01:42:41
“平均每个美国家庭要为战争付出近1400美元”

“平均每个美国家庭要为战争付出近1400美元”

极目新闻
2026-07-26 12:13:21
一场“拼夕夕”式战争:乌克兰小型攻击无人机产量已经跃居世界首位,为何俄罗斯不能复制?

一场“拼夕夕”式战争:乌克兰小型攻击无人机产量已经跃居世界首位,为何俄罗斯不能复制?

民用无人机
2026-07-24 13:21:30
负责人匆忙追上中央考核巡查组,提供的却还是错误图纸

负责人匆忙追上中央考核巡查组,提供的却还是错误图纸

阜阳发布
2026-07-25 22:11:16
百万粉丝“女网红”落网,向直播间的刷榜大哥私下贩卖定制私密视频牟利,两人被依法执行逮捕

百万粉丝“女网红”落网,向直播间的刷榜大哥私下贩卖定制私密视频牟利,两人被依法执行逮捕

极目新闻
2026-07-26 12:08:42
上海交大医学院就仇某某发表医学论文及临床研究报道发布情况说明

上海交大医学院就仇某某发表医学论文及临床研究报道发布情况说明

新京报
2026-07-26 13:38:18
携程的几个创始人

携程的几个创始人

舜口说
2026-07-25 10:45:07
泰山陪爬变陪“睡”?贴身搂抱、明码标价变味儿,这山爬得太辣眼

泰山陪爬变陪“睡”?贴身搂抱、明码标价变味儿,这山爬得太辣眼

李虰手工制作
2026-07-24 20:18:33
内讧?曝阿根廷所有球员拒绝联系恩佐:世界杯决赛输球,都怪你

内讧?曝阿根廷所有球员拒绝联系恩佐:世界杯决赛输球,都怪你

念洲
2026-07-25 16:56:53
震惊!王虹戴着20000多元的卡地亚首饰去美国领奖,被人指责不够朴素,说科学家就该像韦东奕那样清贫

震惊!王虹戴着20000多元的卡地亚首饰去美国领奖,被人指责不够朴素,说科学家就该像韦东奕那样清贫

火山詩话
2026-07-26 11:19:26
拒与台湾地区代表同台,大陆代表团集体退场,澳洲要付出什么代价

拒与台湾地区代表同台,大陆代表团集体退场,澳洲要付出什么代价

离离言几许
2026-07-25 18:43:13
天雷滚滚,龙头中报亏135亿,这65股亏损超5亿,集中在6个方向

天雷滚滚,龙头中报亏135亿,这65股亏损超5亿,集中在6个方向

鹏哥投研
2026-07-26 09:36:29
2026-07-26 14:07:00
智驾最前沿
智驾最前沿
自动驾驶领域专业的技术、资讯分享平台。我们的slogan是:聚焦智能驾驶 ,紧盯行业前沿。
524文章数 11关注度
往期回顾 全部

科技要闻

传DeepSeek 100亿元新一轮融资突然放缓

头条要闻

媒体:拖了10年的高铁项目再生事端 "哥哥妹妹"闹翻了

头条要闻

媒体:拖了10年的高铁项目再生事端 "哥哥妹妹"闹翻了

体育要闻

拿过两个金球奖,却说它只值10英镑

娱乐要闻

谢贤前女友Coco直播崩溃落泪!

财经要闻

德法带头反水 欧盟制裁俄罗斯沦为笑话

汽车要闻

轿跑姿态+大空间/标配655km续航 奇瑞风云A9置换价10.68万起

态度原创

旅游
艺术
房产
家居
公开课

旅游要闻

泡泡玛特城市乐园夏季夜游活动点亮夜经济

艺术要闻

20幅 抒情宁静的小幅俄罗斯风景油画

房产要闻

37人抢1套房…海棠湾资产拍卖,爆了!

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版