网易首页 > 网易号 > 正文 申请入驻

解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

0
分享至

来源:市场资讯

(来源:机器之心)


  • 论文标题:WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

  • 论文链接:https://arxiv.org/pdf/2608.01035

  • Github 仓库:https://github.com/fudan-generative-vision/WAM-Diff2

  • 作者单位:复旦大学、引望智能技术有限公司


1:WAM-Diff2 的多任务性能、解码效率与长时域规划结果总览。

导读

视觉 - 语言 - 动作(VLA)模型已成为端到端自动驾驶的主流技术路线,但基于自回归(AR)解码的现有架构面临双重结构性瓶颈:其一,逐 Token 串行生成导致推理延迟随序列长度线性增长,严重制约实时部署;其二,训练阶段依赖真实前缀的 teacher forcing 机制,使模型在推理时暴露于自身生成的误差之上,引发长时序累积的曝光偏差(exposure bias)。

扩散模型支持多位置并行更新,并可在多轮去噪中反复修正中间结果,是突破上述瓶颈的自然选择。然而,现有扩散策略大多围绕单一规划任务从头训练,无法继承大规模自回归模型已习得的语义知识与多任务推理能力。一个关键问题由此浮现:能否在不依赖从头训练的前提下,将成熟的多任务自回归 VLA 平滑迁移为并行扩散架构?

针对这一问题,复旦大学与引望智能联合提出 WAM-Diff2,一种基于三级层次化蒸馏的多任务离散扩散 VLA 框架。其核心贡献可概括为三方面:

1. 通用架构转换范式:首次系统性地实现了多任务自回归 VLA 向离散扩散模型的平滑迁移,完整保留语义知识与统一接口,而非退化为单一任务的扩散规划器;

2. Block-Causal 注意力与三级渐进蒸馏:提出 Block-Causal 注意力机制作为连接因果生成与双向生成的连续桥梁,并设计渐进式块级适配、范式一致的块级蒸馏与跨规模模型级蒸馏的三级策略,在消除曝光偏差的同时确保优化稳定性;

3. 系统级效率与多任务性能的统一:仅生成范式转换即实现 2.8 倍解码加速,叠加 FlashInfer 内核优化与 CUDA Graphs 执行图封装后累计加速达 15.1 倍,且驾驶理解、视觉感知与运动规划性能均与自回归基线持平,长时域规划鲁棒性更优。

一、研究背景:

自回归 VLA 的效率与鲁棒性瓶颈

VLA 模型将自然语言回答、目标定位与未来轨迹统一为 Token 序列,使单一网络能够同时承担驾驶场景理解、视觉感知与运动规划,已成为端到端自动驾驶的重要技术路线。然而,主流驾驶通用模型大多构建于自回归视觉 - 语言模型之上,存在两方面结构性局限。

效率瓶颈:逐 Token 串行解码的计算复杂度随序列长度线性增长,高推理延迟直接制约实时部署。在自动驾驶场景中,毫秒级的延迟差异可能意味着安全与事故的分野。

鲁棒性瓶颈:训练阶段依赖 teacher forcing 机制,模型在每一步均使用真实前缀作为输入;而推理阶段则暴露于自身生成的输出之上。这种训练 - 推理分布的错位导致早期误差沿长时序持续累积,即曝光偏差问题。在长时域轨迹规划中,该偏差会随预测步数单调放大,严重削弱闭环执行的可靠性。

扩散模型通过并行去噪与多轮修正,理论上可同时缓解上述两大瓶颈。然而,既有扩散策略大多围绕单一规划任务从头训练,难以继承自回归 VLA 在驾驶场景理解、视觉感知与多任务推理中积累的语义知识。若直接切换至大块扩散解码,实验表明 NAVSIM PDMS 将由 88.1 骤降至 84.1,证明架构转换不可一蹴而就,必须循序渐进。

WAM-Diff2 的核心思路正是提供一条可复用的低成本的架构转换路径:完整保留成熟自回归 VLA 已习得的知识与统一接口,通过 Block-Causal 注意力与三级层次化蒸馏,将逐 Token 续写平滑改造为并行去噪,从而实现多任务认知能力与并行执行效率的统一。

二、核心方法:

离散扩散模型与三级层次化蒸馏

2.1 Block-Causal 注意力:连接顺序生成与并行生成的连续桥梁

WAM-Diff2 基于 Qwen3-VL 骨干网络构建,将输出序列划分为若干解码块。块内 Token 可双向交互、并行修正,块间仍保持因果依赖。块大小 B 由此成为连接两种生成范式的连续调节变量:B=1 时等价于标准自回归解码,B 越大则单次并行处理的 Token 越多。

自然语言问答、二维检测与运动规划均被序列化至同一 Token 空间,全程不引入任何任务专用头。因此,本方法的转换对象是覆盖理解、感知与规划的完整 VLA,而非单一轨迹生成模块。这一设计确保了架构迁移过程中多任务能力的完整性。


2:WAM-Diff2 整体架构与三级 AR-to-Diffusion 层次化蒸馏流程。

2.2 三级层次化蒸馏:渐进式改变模型的生成范式

架构转换面临注意力模式(因果与双向)与优化目标(next-token prediction 与 masked denoising)的双重范式鸿沟。WAM-Diff2 通过三级递进策略实现平稳过渡:

第一阶段:渐进式块级适配(Progressive Block-wise Adaptation)

将解码块大小按 1→4→8→16→32 逐级扩大,每一级均以前一级权重初始化。模型在小幅结构变化中逐步学习更大范围的双向依赖,避免了大步长切换导致的优化崩溃,确保注意力机制转换过程的稳定性。

第二阶段:范式一致的块级蒸馏(Block-wise Distillation)

以稳定的小块扩散教师指导更大块的学生模型。教师与学生在同一受损序列上进行预测,并采用对称 Jensen-Shannon 散度(JSD)对齐 Token 分布。相比前向 KL 散度易引发的 mode-covering 行为,JSD 能够更好地保留多模态轨迹分布特性。学生由此学习如何处理带噪、不完整的中间状态,而非继续模仿自回归教师的单向续写,从源头消除曝光偏差。

第三阶段:跨规模模型级蒸馏(Model-wise Cross-Scale Distillation)

以 8B、Block-32 扩散模型指导 2B、Block-32 学生。研究发现,8B 扩散教师与 2B 学生的 Top-5 Token 重合率达 58.2%,显著高于 8B 自回归教师的 51.2%;对应 NAVSIM PDMS 分别为 88.3 与 79.9。该结果表明,除教师规模外,师生生成范式是否一致同样是知识高效迁移的前提条件。扩散教师与扩散学生之间的范式一致性,显著降低了知识蒸馏的摩擦损耗。


3:三级蒸馏、蒸馏损失、Token 重合率与教师范式的消融结果。

三、系统级加速:

从 2.8 倍到 15.1 倍的效率跃迁

在统一多任务模型下,Block-32 的标准实现达到 124.8 Tokens/s,较自回归基线的 44.5 Tokens/s 提升 2.8 倍。在此基础上,团队针对 Block-Causal 注意力模式定制 FlashInfer 计算内核,通过提升共享内存吞吐进一步加速 1.7 倍;进而利用 CUDA Graphs 封装固定去噪步数的执行图,消除 CPU 逐算子发射开销,再加速 3.1 倍。

解码延迟由 22.7 ms/token 依次降至 8.1、4.6 与 1.5 ms/token,最终形成 15.1 倍累计加速,峰值吞吐达 673.4 Tokens/s,而运动规划指标变化不超过 0.5 个百分点。实验进一步表明,NAVSIM、DriveBench、COCO 与 LingoQA 上的性能大多在 8~16 个去噪步附近趋于饱和,部署时可根据精度与延迟需求动态配置计算预算,实现运行时可调的效率控制。



4:不同去噪步数下的性能变化,以及多基准上的速度与精度 Pareto 曲线。

四、实验结果:

单一模型保留多任务能力,长时域规划更稳健

WAM-Diff2 在 DriveBench、LingoQA、COCO、NAVSIM 与 Bench2Drive 五个基准上接受评估。在统一多任务协议下,全部结果来自同一冻结检查点:2B、Block-32 模型取得 48.80 DriveBench、65.80 LingoQA、36.30 COCO mAP、87.44 NAVSIM-v1 PDMS 与 87.50 NAVSIM-v2 EPDMS,同时将标准解码吞吐由 44.5 提升至 124.8 Tokens/s。上述结果表明,模型以可控的性能代价换取显著的并行收益,并未退化为仅会规划的专用网络。


1:统一多任务模型在理解、感知、规划与解码效率上的综合结果。

在任务专用的 NAVSIM 设置下,Block-32 取得 88.3 PDMS 与 88.6 EPDMS;结合候选轨迹评分后进一步提升至 91.1 与 90.7,优于 ReCogDrive(90.8 PDMS)、DriveVLA-W0(90.2 PDMS)等先进专用规划模型。在 Bench2Drive 闭环仿真中,模型取得 49.55% 成功率与 78.93 驾驶得分,并在紧急制动(61.67%)、交通标志遵守(85.26%)等安全关键场景中保持较强表现,印证了蒸馏框架对推理期曝光偏差的缓解作用。


2:WAM-Diff2 在 NAVSIM-v1/v2 上的任务专用规划结果。


3:WAM-Diff2 在 Bench2Drive 闭环评测与多能力测试中的结果。



5:WAM-Diff2 在驾驶理解与视觉感知任务上的定性可视化结果。


图 6:WAM-Diff2 在 Bench2Drive 上的典型失败案例。

长时域误差实验进一步揭示了扩散生成的价值。团队在 12,146 个 NAVSIM 配对样本上比较未来路点的 L2 误差:自回归基线的平均误差为 0.5935 米,WAM-Diff2 为 0.5589 米,整体降低 5.8%;两者的误差差距从第一个路点的 0.002 米单调扩大至第八个路点的 0.082 米。块内双向注意力使模型能够反复修正不确定位置的预测,从而有效抑制误差随预测时域的累积,提升闭环执行对序列漂移的鲁棒性。


7:自回归基线与 WAM-Diff2 的逐轨迹点 L2 误差及误差降幅。

五、总结与展望

WAM-Diff2 展示了一条区别于从头训练扩散模型的技术路线:先依托成熟自回归 VLA 获得理解、感知与规划能力,再借助 Block-Causal 注意力与三级层次化蒸馏,将上述能力平滑迁移至可并行执行的离散扩散架构。在实现最高 15.1 倍解码加速的同时,模型完整保留了自回归基线的多任务性能,并在长时域规划中展现出更强的误差抑制能力。

需要指出的是,离散 Token 化可能引入空间量化误差,且扩散学生的能力上界受限于自回归教师的语义推理水平,这也构成后续工作的改进方向。总体而言,该框架不依赖特定基础模型,形成一条低成本、可扩展的通用转换管线,可直接迁移至现有及未来的先进自回归 VLA,为自动驾驶多模态智能在严格吞吐约束下的部署提供了可行方案。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
突发!OpenAI紧急暂停GPT-6训练

突发!OpenAI紧急暂停GPT-6训练

新智元
2026-08-19 07:16:27
10个理由,一定要逼自己瘦下来

10个理由,一定要逼自己瘦下来

健身狂人
2026-08-17 10:39:51
刘慧,受贿数额特别巨大

刘慧,受贿数额特别巨大

新京报
2026-08-18 10:11:24
43岁范冰冰受封拿督,事业疑获新大佬支持,全面进军海外市场

43岁范冰冰受封拿督,事业疑获新大佬支持,全面进军海外市场

萌神木木
2025-08-24 13:52:35
不靠先进光刻机也能做出顶级芯片,华为 Mate90 被称史上最强 Mate

不靠先进光刻机也能做出顶级芯片,华为 Mate90 被称史上最强 Mate

科技生活快讯
2026-08-18 12:30:03
邹市明和冉莹颖开的拳馆,前员工甩出账目明细:300万水晶灯来自表弟,800万装修进了表妹公司,450万安保费包给外甥,70万绿植钱归亲哥

邹市明和冉莹颖开的拳馆,前员工甩出账目明细:300万水晶灯来自表弟,800万装修进了表妹公司,450万安保费包给外甥,70万绿植钱归亲哥

背包旅行
2026-07-31 11:39:46
峰学蔚来董事见面会!张雪峰妈妈坐C位,张姩娢和妈妈似复制粘贴

峰学蔚来董事见面会!张雪峰妈妈坐C位,张姩娢和妈妈似复制粘贴

牛锅巴小钒
2026-08-19 07:32:14
被项立刚猜中, 蒸汽弹射才是王道: 电弹不如蒸弹 中压直流不如交流

被项立刚猜中, 蒸汽弹射才是王道: 电弹不如蒸弹 中压直流不如交流

共工之锚
2026-08-19 00:17:10
作家李娟称没工作比干流水线苦冲上热搜,引起无数打工人的共鸣,她还说只有贫穷才是真正的痛苦!

作家李娟称没工作比干流水线苦冲上热搜,引起无数打工人的共鸣,她还说只有贫穷才是真正的痛苦!

黯泉
2026-08-18 17:27:11
帕劳总统称希望太平洋岛国就中国近期洲际弹道导弹试射一事形成“统一战线”,中方:帕方言论毫无根据、用心险恶,不值一评

帕劳总统称希望太平洋岛国就中国近期洲际弹道导弹试射一事形成“统一战线”,中方:帕方言论毫无根据、用心险恶,不值一评

政知新媒体
2026-08-18 15:32:38
王骁风波持续升级,继财产争议后更多细节曝光,网友感叹张译确实未说谎

王骁风波持续升级,继财产争议后更多细节曝光,网友感叹张译确实未说谎

草莓解说体育
2026-08-19 08:55:38
徐向前晚年吐露终极秘史:若无西安事变,红军早已开启第二次长征

徐向前晚年吐露终极秘史:若无西安事变,红军早已开启第二次长征

范剬舍长
2026-08-16 10:21:07
“孩子化疗不能吃辣”,爸爸点外卖备注提及病情,不料老板看到后悄悄放入一张百元现金

“孩子化疗不能吃辣”,爸爸点外卖备注提及病情,不料老板看到后悄悄放入一张百元现金

黄河新闻网吕梁
2026-08-19 09:10:43
德约科维奇:我要在洛杉矶奥运会结束职业生涯

德约科维奇:我要在洛杉矶奥运会结束职业生涯

网球之家
2026-08-18 09:59:05
一张显卡单挑 GPT-5.6!Qwen3.8-27B 最新评测出炉,大模型变天了

一张显卡单挑 GPT-5.6!Qwen3.8-27B 最新评测出炉,大模型变天了

AI范儿
2026-08-19 10:21:03
旧江湖的最后一醉

旧江湖的最后一醉

大嘴説
2026-08-18 16:37:03
穆里尼奥:执教皇马是足球教练中最至高无上的荣耀

穆里尼奥:执教皇马是足球教练中最至高无上的荣耀

懂球帝
2026-08-19 10:36:12
人社部工作会议落幕,网传工资统一上调,看清背后真实信号

人社部工作会议落幕,网传工资统一上调,看清背后真实信号

陈博世财经
2026-08-18 12:46:01
独家披露:韩铠伊冒死给慈善家李春平生儿子!身边人毒计迭出

独家披露:韩铠伊冒死给慈善家李春平生儿子!身边人毒计迭出

细品名人
2026-08-19 08:56:47
超强厄尔尼诺概率超90%!今冬或迎史上最强,中国天气会怎样?

超强厄尔尼诺概率超90%!今冬或迎史上最强,中国天气会怎样?

李摻穷游天下
2026-08-18 17:39:00
2026-08-19 11:40:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4466153文章数 9322关注度
往期回顾 全部

科技要闻

宇树科技1100元开盘,较发行价上涨629%

头条要闻

牛弹琴:日本大使被叫去挨骂 25分钟脸色铁青

头条要闻

牛弹琴:日本大使被叫去挨骂 25分钟脸色铁青

体育要闻

在国际球探眼中,中国年轻球员是什么水平?

娱乐要闻

230万变3亿,章子怡活成自己的靠山

财经要闻

重要信号 部分存储芯片现货价格松动下行

汽车要闻

启境GX7空间能力有多强?2米大个沉浸体验

态度原创

数码
本地
健康
时尚
公开课

数码要闻

LG Display首度展示FMM-less OLED像素沉积图案化技术FLiPP

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

女孩更易侧弯?几类孩子风险偏高

秋天流行穿粉色,减龄又好看!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版