长期以来,人们默认自动驾驶是一个“单车大脑”问题:只要把摄像头、激光雷达和模型做得足够好,一辆车就能独立应对一切。CMU-Drive和V2V-VLA两项新研究给出了相反答案。它们认为,单辆车独自推理总会撞上同一堵墙——视线遮挡、盲区、被卡车挡住的路口——解决之道不是更强的单智能体模型,而是让车辆之间实时对话,共享视觉-语言-动作推理,合作而非各猜各的。
论文的核心是一个新的评测基准CMU-Drive。现有自动驾驶基准每次只给一辆车打分,因此无法回答“多车协同是否真的更聪明”这个问题。CMU-Drive专门填补这一空白,用于测试车对车(V2V)的视觉-语言-动作模型在协作推理上的表现。论文同时发布了配套模型V2V-VLA,在仿真环境中验证多车共享信息后的决策质量。
需要注意的是,这还不是一套上路运行的车队,也不是监管文件。它是一份研究产物:一个基准和一个模型架构,已发布到arXiv,目的是为“协同驾驶推理”这个此前没有统一尺度的领域提供公共标尺。
论文中的协作推理演示,距离现实中两辆车因为另一辆车无线电通报而安全并线,仍有一道基础设施鸿沟。VLA模型可以在仿真中学会协作,但要让不同车企的车辆在真实高速公路上共享推理,需要通信标准、已装车的低延迟V2V硬件,以及竞争对手愿意让自家汽车接入别家模型。这些都不是机器学习问题,而是多年来阻碍V2V标准的协调问题——模型论证往往走在行业协作之前。
论文作者暗示,真正能缩小差距的,不是论文仿真场景里更高的基准分数,而是通信层从零开始的建设。CMU-Drive的价值在于,它第一次让“协同驾驶有没有用”有了可测量的起点。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.