网易首页 > 网易号 > 正文 申请入驻

ECCV 2026|自驾VLA Scaling有戏了

0
分享至

来源:市场资讯

(来源:机器之心)

论文的团队来自于清华大学产业研究院(AIR),滴滴,北京航空航天大学。团队近年在自动驾驶与具身智能领域发表论文数十篇,并和国内外知名高校、科研机构广泛开展合作。

该论文的第一作者为杨予光,北京航空航天大学博士研究生,研究方向为自动驾驶与具身智能,提出首个 MLLM 原生自动驾驶模型 CuriousVLA,也是当前自动驾驶领先模型 CLOVER 的重要贡献者。迄今已在 ICLR、NeurIPS、CVPR、ICCV、ECCV 等顶级会议发表论文 7 篇,长期担任相关顶会审稿人,并获 CCF 中国计算机学会年度应用奖励。

本文主要介绍来自该团队的最新论文 Teaching Vision-Language-Action Models What to See and Where to Look,目前该论文已经被 ECCV 2026 正式接收,相关代码和模型已全部开源。

该工作聚焦于自动驾驶场景中的自回归型 VLA 模型的训练,主要的观点是现有 VLA 的交通相关数据在很大程度上依赖以文本为中心的视觉问答和思维链推理数据,这类数据更强调语言推理,而非基于动作的规划。为解决这一问题,该工作提出利用交通要素蒸馏的方式纠正 VLA 模型的关注要素,使其更加关注视觉要素;同时,该工作还提出了一种将 BEV 轨迹映射到图像像素空间进行学习的技术,这能够充分利用基模已有的视觉能力,使轨迹内在的空间含义对模型更加可理解。DriveTeach-VLA 在 NAVSIM 上进行了评测,达到 90.4 的 PDMS;在进一步运用 Drivor 轨迹选择器后 PDMS 可以提升至 92.7,取得了当前最先进的性能。


  • 论文题目:Teaching Vision-Language-Action Models What to See and Where to Look

  • 合作机构:北京航空航天大学,清华产业研究院,滴滴,中国传媒大学

  • 论文链接:https://arxiv.org/pdf/2607.01658

  • 项目主页:https://github.com/ShivaTeam/DriveTeach-VLA

研究背景与挑战:自动驾驶模型无法从互联网预训练中获益

设想一个并不罕见的情景:自车准备左转,右侧有行人靠近斑马线,前方的大车遮住了部分视野。得益于多模态基模在互联网数据中习得的强大预训练能力,如今视觉 — 语言 — 动作模型(VLA)已经能把这种场景的应对措施描述得很好:应该减速、观察、礼让行人,然后再左转。但是,这种大语言模型均具备的能力,真的能决定车辆驾驶与控制的安全吗?真正决定安全的,是模型生成轨迹时究竟看向了哪里:它有没有盯住行人?有没有理解被遮挡区域?所谓 “左转”,又是否对应到画面中那条真实可行驶的车道?

论文通过几个例子非常直观展示了这种机制的必要性,下图 (a) 是一个常见的 VLA 模型基线,使用 Qwen2.5-VL 适配自动驾驶数据,结果模型的关注点是非常分散的分布在图上,并没有明确的注意力焦点。论文分析这种注意力失焦的问题主要是由于现在的 VLA 训练实际上是在把大语言模型当作一个大的拟合器在用,VLA 只是独立的学习如何根据场景输出对应的思维链和给出对应的轨迹,并没有真正 “明白” 思维链与轨迹预测之间的关系。


DriveTeach-VLA 清华北航团队认为,VQA 和思维链可以教模型理解交通语义,却不能自动保证语言推理与控制所对应的规划空间是一致的。因此,该论文的思路是,让模型学习如何在轨迹推理的时候关注那些语言推理中涉及到的视觉要素,从而最后影响车辆轨迹的生成。简单说,就是先教模型哪些地方值得关注,再教它接下来应该看哪里,从而引导模型把注意力聚焦于车道,行人,红绿灯等与交通规则密切相关的位置。

具体来说,DriveTeach-VLA 没有继续堆叠更长的思维链解释文本,而是把视觉 - 语言 - 动作训练拆成三件更具体的事:先教模型识别什么值得看(learns what to see),再告诉它未来应该看向哪里(learns where to look),最后校正它怎么开(learns how to drive)。

第一课:把交通常识教进视觉编码器(What to See,DVD Pretraining)

VLA 之所以运用多模态大模型作为基座,是因为在预训练过程中见过海量的图片可以提供大量的世界先验知识。但是,在具体的自动驾驶场景中,路边广告牌和正在横穿的行人,对下一秒轨迹的重要性完全不同。因此,DriveTeach-VLA 设计了驾驶知识驱动的视觉蒸馏方法( Driving-aware Vision Distillation,DVD)。

训练时,首先由 GroundingDINO 先标出车辆、行人、路障和交通灯等关键对象;论文希望 VLA 能够尽可能多的关注这些关键对象,为此,论文参考了牛津大学视觉几何组(VGG)对CLIP的视觉提示研究工作,只要在图像上用明显的视觉标识标记物体,就能直接改变模型的注意力。为此,运用了自蒸馏的思想,将 VLA 基座的 ViT 拷贝为学生 ViT 和教师 ViT,由 GroundingDINO 标注出的 bbox 框标注在图像上,输入给教师 ViT,而学生 ViT 只读原图。

教师 ViT 由于受到 bbox 框标注的引导,注意力会自然偏向于那些被标记的交通要素,而学生 ViT 则直接学习这些被注意力矫正后的特征。这样一来,教师所拥有的 “交通对象提示”,可以通过蒸馏算法迁移给学生。在蒸馏方式方面,论文使用的则是类似 Swin Transformer 的块级感知蒸馏,也就是将特征图先分块后再平均池化,这样尽可能多的获取到由框矫正带来的特征变化。



论文还进一步尝试给 GroundingDINO 输出的标注框通过随机丢弃(Random drop)和框扰动(Jitter bbox)检验由 GroundingDINO 这种预标注带来的性能增益是否稳定。实验结果显示出 DVD 能带来约 1.4 的 PDMS 改善,而且在增加了 20% 的噪声后,DVD 依然能带来良好的性能增益。


第二课:在画面里指出 “未来要走的地方”(Where to Look,2D-TGP 图像轨迹)

论文还从基座预训练的角度给出了一个见解,认为现在大家将多模态模型基座想象成了在自驾领域需要从头开始学习的模型。但实际上,多模态模型基座受益于预训练时大量的数据,对于交通、路况等场景的理解能力的适配是很容易学习的。而真正的瓶颈在于自动驾驶规划通常在鸟瞰(Bird-Eye-View,BEV)坐标系中输出轨迹,这种轨迹的含义对于基模而言是难以被直接理解的。

为此,DriveTeach-VLA 引入 2D Trajectory-Guided Prompt(2D-TGP):利用相机内外参,把专家驾驶轨迹从 BEV 坐标系投影到图像平面上,得到一串像素坐标;随后再把这些像素坐标组织成文本形式,作为提示输入给 VLA 模型。这样一来,模型看到的不再只是 “左转” 这种语义指令,而是同时获得了一个更具体的视觉参照:未来轨迹大致应该经过图像中的哪些位置。而幸运的是,多模态基模在预训练时已经习得了很好的读图能力,2D-TGP 则通过图像轨迹的方式直接关联了规划空间与多模态基模的读图能力。


例如下图,“向左转” 这一条语义指令,能够被 2D-TGP 转化为标注在图像上的一串可被大模型直接理解的 2D 图像指标。


在系统设计上,DriveTeach-VLA 使用了两个 Qwen2.5-VL-3B 模型进行分工。第一个模型是 TGP-Prompter,负责根据当前图像、车辆状态和驾驶指令,先预测图像平面上的 2D-TGP;第二个模型是 TGP-Planner,它再结合图像、车辆状态、驾驶指令以及这个 2D-TGP 提示,生成最终的 BEV 轨迹。


这里的训练方式也值得注意。受启发于基模 “下一个 token” 预测的 teacher-forcing 范式,在训练 Planner 时,论文使用的是真值 2D-TGP,也就是由专家轨迹投影得到的标准提示;但在推理阶段,Planner 拿到的则是 TGP-Prompter 自己预测出来的 2D-TGP。


不过,这就带来了一个自然的问题:训练时模型看到的是相对准确的轨迹提示,测试时却要依赖另一个模型预测出来的提示,两者之间可能存在 teacher forcing 导致的训练 — 测试差距。作者对此特别进行了验证,整体上看图像轨迹是能被较为准确的预测的,同时图像轨迹的质量尽管对于最终的 BEV 轨迹预测起着关键作用,但是整体的性能也不会因为图像轨迹的略微误差而导致崩溃,这展示了图像轨迹作为一种良好的中间表示的重要性。


实验结果:消融,NAVSIM,nuScene

论文对 DVD 和 2D-TGP 进行了非常细致的消融验证。Qwen2.5-VL-3B 基线为 84.8 PDMS;加入 VQA 与 CoT 后升至 86.4,说明语言监督确实有用。继续加入 DVD 后达到 87.3,加入 2D-TGP 后为 88.2;再经过 GRPO 行为对齐,完整系统单次推理达到 90.4 PDMS、85.4 EPDMS。


另一个容易被忽略的细节是,DriveTeach-VLA 的提升并非简单地来自模型规模。实验所用的 Planner 仍是 3B 级的,因此主要变化发生在监督方式和中间接口上。当模型已经具备基本语言推理能力时,继续增加文本未必是最高效的;更直接的空间监督,可能比 “让模型多想几步” 更接近规划的瓶颈。作者报告了他们在 NAVSIM 和 nuScene 的结果,均超过了已有的 SoTA VLA 模型。其中 NAVSIM 的 PDMS 达到 90.4,而 nuScene 的 L2 误差仅为 0.3。



另外,DriveTeach-VLA 作为一个没有引入扩散或者连续 MLP 映射层,仅依靠基模自身能力进行推理的 VLA 模型,还继承了大语言模型由采样带来的优良性质,如果允许每个场景生成 12 条候选轨迹,再由 DrivorR 选择器挑选,结果可提升到 92.7 PDMS、89.0 EPDMS。尽管在实际运行中不能这样做,但是这意味着后续的研究者可以通过例如模型蒸馏的方式,进一步提升模型的性能上限。


总结

DriveTeach-VLA 最有价值的地方,不仅仅是其更好的 NAVSIM 跑分,而是论文发现了一种能够有效地将 BEV 轨迹与基模原先的识图能力进行直接关联的桥梁,这意味着对于大规模 VLA 训练所依赖的数据可以进一步降低,模型通过这种方式能够直接理解到 BEV 轨迹内在的空间含义。如果再把它和作者的前作 CuriousVLA 放在一起看,这条思路会更清楚。CuriousVLA 强调的是纯多模态大模型路线:不额外引入扩散式动作头,而是尽量依靠自回归推理完成驾驶决策。因此,这两项工作合起来,其实给出了一种 VLA scaling 的蓝图:用多模态基座承担场景理解和推理,用显式空间提示把 BEV 轨迹接回图像空间,最终通过自回归推理的方式实现多模态大模型在大规模自动驾驶数据上的 scaling。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
有人发帖:体制内已经裁了120万编外临时工,网友却说:我看到的是无人被裁,每天还在增加!

有人发帖:体制内已经裁了120万编外临时工,网友却说:我看到的是无人被裁,每天还在增加!

黯泉
2026-08-11 09:57:25
大学刚毕业,即将成为老师的程梦园,失联14天后遗体找到,太可惜了

大学刚毕业,即将成为老师的程梦园,失联14天后遗体找到,太可惜了

东东趣谈
2026-08-10 17:23:45
长江存储CEO含泪感谢华为,给了国产存储最稀缺的旗舰验证机会!网友点赞:Mate20上京东方、Mate40上长江、还有欧菲光

长江存储CEO含泪感谢华为,给了国产存储最稀缺的旗舰验证机会!网友点赞:Mate20上京东方、Mate40上长江、还有欧菲光

大白聊IT
2026-08-11 00:33:20
牵手无锡特食院 澳优“全家营养”按下加速键

牵手无锡特食院 澳优“全家营养”按下加速键

铑财
2026-08-11 10:06:44
索要飞机+股份+房产!!他真是让人大开眼界!

索要飞机+股份+房产!!他真是让人大开眼界!

柚子说球
2026-08-11 00:50:34
大鹏:我这辈子最勇敢的决定,就是扛住所有人嘲笑从《煎饼侠》死磕到了百花奖

大鹏:我这辈子最勇敢的决定,就是扛住所有人嘲笑从《煎饼侠》死磕到了百花奖

飘飘然的娱乐汇
2026-08-10 23:46:12
新疆姑娘闪婚印度总裁,刚下飞机被金链套住,才知丈夫竟是婆罗门

新疆姑娘闪婚印度总裁,刚下飞机被金链套住,才知丈夫竟是婆罗门

小蜜情感说
2026-08-11 07:08:13
百花奖落幕,“王宝强0票”引争议,网友吐槽:演都不演了?

百花奖落幕,“王宝强0票”引争议,网友吐槽:演都不演了?

草莓解说体育
2026-08-11 00:20:04
男童被巨浪卷走后续,官媒怒批家属,当地不敢救,救了也必死无疑

男童被巨浪卷走后续,官媒怒批家属,当地不敢救,救了也必死无疑

社会日日鲜
2026-08-11 09:21:27
第二批朝鲜兵抵达俄罗斯!兵力5万+新武器,泽连斯基最担心的事情还是发生了

第二批朝鲜兵抵达俄罗斯!兵力5万+新武器,泽连斯基最担心的事情还是发生了

军武次位面
2026-08-10 17:55:01
世界小姐“雅典娜”确认遇害,细节公开:被闺蜜骗去菲律宾,落地后被绑架团伙控制,绑匪收到赎金后仍将其杀害,主犯刘某文已被遣返回国

世界小姐“雅典娜”确认遇害,细节公开:被闺蜜骗去菲律宾,落地后被绑架团伙控制,绑匪收到赎金后仍将其杀害,主犯刘某文已被遣返回国

扬子晚报
2026-08-10 18:52:24
“日本没被原子弹炸过”!篡改历史的回旋镖砸向日本

“日本没被原子弹炸过”!篡改历史的回旋镖砸向日本

环球时报国际
2026-08-11 07:59:45
19岁俄少女被诱骗进缅甸电诈园,拒绝从事诈骗遭殴打虐待,自称惊险游河逃入泰国;俄罗斯大使馆已介入

19岁俄少女被诱骗进缅甸电诈园,拒绝从事诈骗遭殴打虐待,自称惊险游河逃入泰国;俄罗斯大使馆已介入

扬子晚报
2026-08-11 11:23:58
演员贾冰,全网可怜!

演员贾冰,全网可怜!

新动察
2026-08-10 15:29:10
内蒙古一警车被换标成长城汽车,网友称:哪是换标那么简单

内蒙古一警车被换标成长城汽车,网友称:哪是换标那么简单

Mr王的饭后茶
2026-08-11 10:55:29
3000亿烤鱼神话破灭:活鱼泡药水,闭店潮背后藏猫腻!

3000亿烤鱼神话破灭:活鱼泡药水,闭店潮背后藏猫腻!

春之寞陌
2026-08-10 13:13:50
睡车里被酒店收150元住宿费事件反转,媒体致歉

睡车里被酒店收150元住宿费事件反转,媒体致歉

第一财经资讯
2026-08-10 22:36:16
40岁男教师曾因补课被投诉,赌气转岗到县市监局,工资降了、寒暑假也没了,如今反倒感谢当年举报我的家长!

40岁男教师曾因补课被投诉,赌气转岗到县市监局,工资降了、寒暑假也没了,如今反倒感谢当年举报我的家长!

LULU生活家
2026-08-11 08:41:00
国产大飞机C919将于明日起首次执行国际商业航班

国产大飞机C919将于明日起首次执行国际商业航班

界面新闻
2026-08-11 07:58:50
车晓谈前夫李兆会:世上除了我妈他最爱我,但他的爱令我无法承受

车晓谈前夫李兆会:世上除了我妈他最爱我,但他的爱令我无法承受

孤城落日
2026-08-11 09:03:02
2026-08-11 13:31:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4385374文章数 9243关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

俄少女途经中国到缅甸被骗进电诈园虐待 游河逃入泰国

头条要闻

俄少女途经中国到缅甸被骗进电诈园虐待 游河逃入泰国

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

“易烊千玺影帝加冕:00后的崛起!

财经要闻

北京楼市新政落地,观望客开始入场

汽车要闻

搭载猎鹰500/限时售10.49万起 2027款艾瑞泽8PRO上市

态度原创

家居
房产
亲子
旅游
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

海南最难被说服的一群人,把15亿投给了同一个项目!

亲子要闻

人民日报多次预警!孩子手上的电话手表,根本不是单纯的护娃工具

旅游要闻

受降雨影响 郑州市所有涉山涉水景区全部关闭

军事要闻

乌克兰袭击俄罗斯炼油厂 已致13死78伤

无障碍浏览 进入关怀版