小鹏集团通用智能中心负责人刘先明在第二代VLA体验日上抛出一个判断:物理AI真正的难题,是理解世界,并在充满限制的真实世界里行动。这句话背后,是小鹏对智能驾驶模型的一次关键升级。
能力公式里的四个变量
半年前,小鹏提出物理AI能力公式:能力 = 模型 × 算力 × 数据 × 本体。刘先明解释,模型决定智能上限,数据提供世界经验,算力支撑训练与运行,本体让AI真正落地物理世界。这次升级,动的是“模型”这个变量。
真实世界不是一张张静止图片,而是一个不断变化、连续演进的过程。刘先明认为,模型要像人类一样理解世界,必须先理解“时间”。第二代VLA升级的核心,就是让模型第一次建立起对时间维度的理解。
从3D空间到4D时空
小鹏物理世界基座模型首次把“时间”纳入模型,AI理解世界的维度从“3D空间”跃迁至“4D时空”。时间越长、信息越多,模型就需要更快反应、更高频决策,并实现更强的安全能力;模型越大,泛化越强,计算需求也越高。
以前模型看到的更多是当下信息。第二代VLA全新引入Infini-VLA长时序架构,记得前30秒的世界,驾驶判断开始拥有更长的上下文,更多有效信息进入模型。
边看边想边行动
道路情况时刻在变化,模型也需要边看边想。如果决策速度跟不上现实变化,就无法形成真正可靠的物理世界智能。第二代VLA同步提升了模型推理效率,采用流式自回归推理,端到端响应提速300%,实现“边看、边想、边行动”的并行处理。
从能力公式到时间维度,再到推理效率,小鹏这次把“理解时间”作为物理AI落地的关键一步。刘先明没有给出具体量产时间表,但技术路径已经清晰:让模型记住前30秒,再让它在更短时间内做出判断。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.