来源:市场资讯
(来源:爱范儿)
![]()
电影《奇异博士》里,奇异博士转动阿戈摩托之眼,可以让时间向前或向后流动,到了《复仇者联盟 3》,他又在与灭霸的对决前,提前看见了多种可能的未来。
这是电影里的魔法,也是小鹏提供的现实。
8 月 27 日,小鹏开了一个物理 AI 分享会,同时展示了第二代 VLA 的全新版本。这场沟通会最大的关键词是「时间」,小鹏给车上的模型加上一个「阿戈摩托之眼」:往回转,能回溯 30 秒的世界,向前转,则开始预判未来 6 秒会发生什么。
汽车没有时间宝石,但有大模型加持,模型根据过去一段时间里累积的信息,计算出几种概率更高的后续状态,再为眼前这一刻选择动作。对智驾而言,拥有「时间线的记忆」,就能带来更加拟人化的操作。
人在开车时,从来不只看眼前这一帧,你会根据前几秒的记忆判断后方路况,也会根据前车的减速和路边的岔口预判几秒后有可能出现的小电驴。从某种意义上说,驾驶不只发生在路面上,也发生在时间里。
![]()
最新的小鹏第二代 VLA 全新 6.3.0 版本,即是一个在时间流中开车的模型,全新 VLA 将于 9 月开始面向所有 Ultra 和 Ultra SE 车型推送,小鹏 G9L Ultra 与 Ultra SE 将首发搭载,而单图灵芯片 Max 车型也将在 9 月获得第二代 VLA Lite 蒸馏版。
驾驶没有单帧答案
小鹏这次对新 VLA 的核心思路是让过去、现在与未来连在一起。
Infini-VLA 负责记住过去。它的底层架构可以支持更长的时序,小鹏考虑驾驶任务与端侧计算量,将量产版本的历史记忆设置为 30 秒。也就是说它能记住过去 30 秒发生的路面状况,并将其带入到当下的判断中。
小鹏在沟通会上展示了一段演示视频,前车在路中掉头时,车身后方一度露出可以穿过的空位,测试车没有立即加速,而是结合之前的运动过程,等待对方完成掉头后再向前。模型理解的是「前车正在掉头」这个持续发生的行为,不再只有「前方出现空位」这一帧画面。
![]()
这有点像人与别人谈话时的短期记忆,人不会每听一句话就忘掉上一句,驾驶者也不会因为前车此刻横在路中,就忘记它前面做出了准备掉头的举动。
如果说 Infini-VLA 让车辆不再忘记上文,Streaming Inference 「流式自回归推理」则负责缩短车辆理解当下的时间。按照小鹏的解释,模型可以边获取输入、边推理、边输出轨迹,不必等完整理解一段历史之后才开始动作。小鹏给出的数据是,这套流式推理让决策速度提升了 300%。
同样地,这也类似人开车时,眼睛看路、大脑判断、手脚操作同时进行。遮挡处突然出现目标时,这样的并行处理能够少留下一段等待推理完成的空白。
![]()
记得过去,着眼当下,自然也要展望未来。于是新版本 VLA 中的 X-Foresight 会根据历史状态,对未来 6 秒进行推演,Flow Matching 再对多种可能的轨迹分布进行拟合,帮助模型选择更合适的动作。
词汇是晦涩难懂的,但带来的作用是十分清晰的,新版 VLA 通过持续观察当前路况,对未发生但可能出现的情况进行预判,并做下一步决策。而现实生活中老司机们常提到的「防御性驾驶」,本质上也是一种预判。
![]()
现场视频里,一辆对向白车占据了逆向车道。测试车需要判断对方是准备等待、继续向前,还是让出一部分空间,再推演自己此刻前进会不会封死两辆车的通路。看清对方在哪里只是第一步,理解对方将要做什么,才能决定自己下一步的操作。
过去的记忆和未来的推演,最终服务于每一次的加减速和转向,也让第二代 VLA 6.3.0 版本能「在时间里流动」。
进入现实世界
架构图里的名词很多,但回到产品上,VLA 要面对的还是现实道路上的各种麻烦,小鹏的答案是使用更大的模型,这一次小鹏将模型参数量扩大了 3.5 倍。
沟通会播放的一段视频里,测试车来到了轮渡码头。渡口没有清晰的车道线,码头并非一条常规道路,但依靠模型自身的思考,车辆仍然自己找到入口,开上轮渡,跟着前车停下,轮渡靠岸后,它又随车流驶出。
另一段视频发生在狭窄山路,在急弯之后,道路前方出现了一根悬空树枝,车辆没有将它当成普通的路面障碍物停在原地,也没有朝着看似尚有空间的缝隙直接向前,而是主动减速,一边观察树枝与车身的关系,一边寻找能够通过的空间。
![]()
值得一提的是,前些天,一辆运行 FSD v14.3.7 的特斯拉在美国一座公寓停车楼中从二楼一路开到六楼,并试图继续朝顶层金属铁丝网方向寻找通路,好在车主在接近铁丝网时接管,车辆没有坠落。类似的 「corner case」极端案例,小鹏 VLA 和 FSD 却做出了不同的判断,模型除了要看到空间,也要能够理解那是不是一条路。
轮渡和树枝属于很少见的场景,也正是小鹏坚持扩大模型的理由。一套依赖固定规则的系统,可以针对码头、羊群、暴雨或每一种新障碍物分别增加补丁,但真实道路总会出现你意想不到的情况。
更大模型所追求的,是处理这些没有见过的问题,而非为每个场景背下一个答案。
![]()
当然,模型不会凭空获得这种能力,小鹏称,当前模型单次训练的数据吞吐量已达 1 亿个视频片段。它还建立了向量化的数据检索系统,用户上报或测试中出现一个问题后,开发团队可以从数据库中找出更多语义相似的场景,组成一本更有针对性的「错题集」。
模型训练完成后,小鹏的仿真系统会对车型、天气、光照和视角进行变化,反复验证同一个模型。按照小鹏公布的数据,从今年 6 月到沟通会前两周,每日仿真验证的新模型数量提升了 290%。真实数据提供题库,仿真负责考试,暴露的问题再回到数据库变成新的错题。
小鹏将这套模型、数据和仿真的闭环视为物理 AI 的技术底座。依照小鹏的测试口径,新版本在仿真和测试中的综合安全能力提升超过 20 倍,这套能力还要开始进入算力更小的车型。
为了让它进入单图灵芯片的 Max 车型,小鹏用 Hybrid ViT 重新设计了计算量最高的视觉部分,尽量保留视觉输入和大模型的底层能力。
第二代 VLA Lite 将于 9 月开启首批推送,小鹏 G9L Max 也会首发搭载。
![]()
汽车即机器人
Car as Robot,汽车即机器人——这是今天小鹏通用智能中心负责人刘先明给出的定论。
到了模型这一层,这两者其实没有多少分别:感知周围环境,记住之前发生过什么,理解人的意图,将一个含糊的目标变成一系列动作,再在物理世界中把它们做完。
小鹏也在新版本里重构了车端大脑。Omni 全模态模型结合语言、环境和上下文理解用户,Master Agent 再将意图分成车辆可以执行的任务。相比每次只接一张工单的「执行员」,新架构可以记住整段对话,明白这些工单共同指向哪个目标。
![]()
当用户向车辆说出「找个地方靠边停车」,系统不能在接到语音后就在当前车道里刹停,而要先变道至最右侧,观察护栏、公交站和道路环境,排除不合适的区域,找到可以停下的位置。理解语义并从座舱转向驾驶域,执行连续决策,是这套系统的目标。
此外,小鹏的计划是将同一套架构和模型同时用在 L2 驾驶辅助与 L4 Robotaxi 上。按照小鹏公布的最新口径,其 Robotaxi 内测已经完成超过 2000 单,搭载第二代 VLA 的 Robotaxi 近日获得广州市智能网联汽车远程测试资质,可在相关测试道路开展主驾无安全员道路测试。
汽车之外,小鹏还在现场留了一个机器人彩蛋。视频一边是车辆,另一边是机器人在室内完成导航与操作,小鹏称两种本体使用了同一套基座模型,虽说是彩蛋,但这也是「汽车即机器人」的核心逻辑,小鹏也将自己定义为「物理 AI 企业」
![]()
但话又说回来,将汽车与具身智能领域相挂钩,这条路线并非小鹏独有。
特斯拉早已将汽车、Robotaxi、Optimus 机器人和 AI 训练放进同一幅蓝图,理想也将自己的定位从智能汽车转变为「具身智能企业」。车企们的共识,是造车即是做一个能在物理世界中行动的机器人。
毕竟「新造车」已经不那么性感了。它从一个充满想象力的新物种,变成了一片比拼价格、配置、渠道与交付的红海。「物理 AI 公司」显然性感得多,模型、芯片、Robotaxi 和机器人,可以组成一个更诱人的资本故事。
![]()
资本市场的喜好当然是这次身份转换的一个推手,但在热钱之外,从无休止的价格战转向前沿开发,推动技术向前,依然是一件令人兴奋的事,只不过这条道路也同样需要靠持续投入、反复验证和一次次量产兑现走下去。
奇异博士可以在一瞬间看尽多种未来,一家现实世界里的公司却只能一个版本、一辆车地向前。小鹏已经为 VLA 补上了过去 30 秒与未来 6 秒,「物理 AI 公司」这个新身份能否成立,则要看 9 月开始上车的新版本,能不能让车主真的感觉到它记得更多、判断更早、反应更快。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.