解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff 2打通自动驾驶VLA自回归
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换
2026年08月19日 06:59
论文标题:WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA
论文链接:https://arxiv.org/pdf/2608.01035
Github 仓库:https://github.com/fudan-generative-vision/WAM-Diff2
作者单位:复旦大学、引望智能技术有限公司
1 : WAM-Diff2 的多任务性能、解码效率与长时域规划结果总览。
导读
视觉 - 语言 - 动作( VLA )模型已成为端到端自动驾驶的主流技术路线,但基于自回归( AR )解码的现有架构面临双重结构性瓶颈: 其 一 ,逐 Token 串行生成导致推理延迟随序列长度线性增长,严重制约实时部署; 其二 ,训练阶段依赖真实前缀的 teacher forcing 机制,使模型在推理时暴露于自身生成的误差之上,引发长时序累积的曝光偏差( exposure bias )。
扩散模型支持多位置并行更新,并可在多轮去噪中反复修正中间结果,是突破上述瓶颈的自然选择。然而,现有扩散策略大多围绕单一规划任务从头训练,无法继承大规模自回归模型已习得的语义知识与多任务推理能力。一个关键问题由此浮现: 能否在不依赖从头训练的前提下,将成熟的多任务自回归 VLA 平滑迁移为并行扩散架构?
针对这一问题,复旦大学与引望智能联合提出 WAM-Diff2 ,一种基于三级层次化蒸馏的多任务离散扩散 VLA 框架。其核心贡献可概括为三方面:
1. 通用架构转换范式:首次系统性地实现了多任务自回归 VLA 向离散扩散模型的平滑迁移,完整保留语义知识与统一接口,而非退化为单一任务的扩散规划器;
2. Block-Causal 注意力与三级渐进蒸馏:提出 Block-Causal 注意力机制作为连接因果生成与双向生成的连续桥梁,并设计渐进式块级适配、范式一致的块级蒸馏与跨规模模型级蒸馏的三级策略,在消除曝光偏差的同时确保优化稳定性;
3. 系统级效率与多任务性能的统一:仅生成范式转换即实现 2.8 倍解码加速 ,叠加 FlashInfer 内核优化与 CUDA Graphs 执行图封装后 累计加速达 15.1 倍 ,且驾驶理解、视觉感知与运动规划性能均与自回归基线持平,长时域规划鲁棒性更优。
一、研究背景:
自回归 VLA 的效率与鲁棒性瓶颈
VLA 模型将自然语言回答、目标定位与未来轨迹统一为 Token 序列,使单一网络能够同时承担驾驶场景理解、视觉感知与运动规划,已成为端到端自动驾驶的重要技术路线。然而,主流驾驶通用模型大多构建于自回归视觉 - 语言模型之上,存在两方面结构性局限。
效率瓶颈 :逐 Token 串行解码的计算复杂度随序列长度线性增长,高推理延迟直接制约实时部署。在自动驾驶场景中,毫秒级的延迟差异可能意味着安全与事故的分野。
鲁棒性瓶颈 :训练阶段依赖 teacher forcing 机制,模型在每一步均使用真实前缀作为输入;而推理阶段则暴露于自身生成的输出之上。这种训练 - 推理分布的错位导致早期误差沿长时序持续累积,即曝光偏差问题。在长时域轨迹规划中,该偏差会随预测步数单调放大,严重削弱闭环执行的可靠性。
扩散模型通过并行去噪与多轮修正,理论上可同时缓解上述两大瓶颈。然而,既有扩散策略大多围绕单一规划任务从头训练,难以继承自回归 VLA 在驾驶场景理解、视觉感知与多任务推理中积累的语义知识。若直接切换至大块扩散解码,实验表明 NAVSIM PDMS 将由 88.1 骤降至 84.1 ,证明 架构转换不可一蹴而就,必须循序渐进 。
WAM-Diff2 的核心思路正是提供一条 可复用的低成本的架构转换路径 :完整保留成熟自回归 VLA 已习得的知识与统一接口,通过 Block-Causal 注意力与三级层次化蒸馏,将逐 Token 续写平滑改造为并行去噪,从而实现多任务认知能力与并行执行效率的统一。
二、核心方法:
离散扩散模型与三级层次化蒸馏
2.1 Block-Causal 注意力:连接顺序生成与并行生成的连续桥梁
WAM-Diff2 基于 Qwen3-VL 骨干网络构建,将输出序列划分为若干解码块。块内 Token 可双向交互、并行修正,块间仍保持因果依赖。块大小 B 由此成为连接两种生成范式的连续调节变量: B=1 时等价于标准自回归解码, B 越大则单次并行处理的 Token 越多。
自然语言问答、二维检测与运动规划均被序列化至同一 Token 空间,全程不引入任何任务专用头。因此,本方法的转换对象是覆盖理解、感知与规划的完整 VLA ,而非单一轨迹生成模块。这一设计确保了架构迁移过程中多任务能力的完整性。