反击VLA中「L」无用论:用对位置指令泛化能力暴涨20
反击VLA中「L」无用论:用对位置指令泛化能力暴涨20-40%
2026年08月06日 10:3
作为具身智能最主流的路线之一,VLA 快速发展的同时也因为其各种问题被诟病。其中最主要的痛点之一便是指令泛化能力。
大部分论文展示的能力都在训练和测试集指令分布一致的数据上刷点,结果哪怕是像 LIBERO 这种现在看起来简单的数据,在简单改写指令后性能都会暴降。如下图所示,vla-adapter 在 LIBERO-para 上性能暴降 51%。对于具身 AGI 来说,这是一个不能接受的问题,我们期待的是一个在各种环境下能听懂人的各种表述形式的任务指令的机器人。
因此,VLA 真正难的,并不是在固定指令模板上再多拿几个点,而是让同一个任务在不同说法下,最终落到同一套机器人动作上。也就是目标物体没有变化、视觉场景没有变化、成功条件也没有变化,只是换了一种语言表达,机器人仍然应该完成原来的任务。
围绕 VLA 语言泛化的问题,来自 上海交大和无界动力具身智能实验室的联合团队 提出了一项极其简单但非常有效的解法。 通过重新设计语言语义进入视觉与动作计算路径的方式,让模型不依赖大量 paraphrase 训练,也能更稳定地执行改写后的指令。
论文标题: Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models
论文地址:https://arxiv.org/abs/2608.02497
GitHub地址: https://github.com/AutoLab-SAI-SJTU/GSR-ParaVLA
指令只改几个词,VLA 的动作就可能完全不同
当前不少 VLA 工作都在 LIBERO、RoboTwin 等 benchmark 上不断刷新成功率。但标准 benchmark 中的语言通常较为固定,模型在训练和测试阶段看到的指令表达高度相似。
这会掩盖一个基础问题:模型究竟理解了 Instruction 所表达的任务含义,还是只把某种固定说法当成了 0,1,2 这样的任务标签?
例如:抓取较大的红色物体;改写为:拿起尺寸更大的红色方块。对人类而言,两句话对应的是同一个任务。但对 VLA 来说,这种看似微小的变化,可能让原本能够稳定完成的任务直接失败。
本文首先在 LIBERO-Para 上评估了 VLA-Adapter、SmolVLA 和 π0.5 三个模型。LIBERO-Para 是在 LIBERO-Goal 任务基础上构建的语言泛化 benchmark。它保持机器人面对的场景、物体、初始状态和成功标准不变,只改写任务指令中的动作表达、物体描述,或同时改写两者,用来测试模型在任务没变、只是换了一种等价表述的情况下能否继续正确执行任务。
换个表述,VLA性能就会掉这么多 结果显示,SmolVLA 在原始指令上的成功率为 72.0%,面对改写指令时却只剩 4.47%;VLA-Adapter 从 98.2% 降至 46.82%。即便是经过大规模异构数据训练的 π0.5,也仍然存在语言改写带来的性能损失。
换句话说, 在标准指令上取得高成功率,并不等于模型具备稳定的 Instruction 跟随能力。
但成功率下降只能说明问题存在,并不能解释问题出在哪里。
对于后训练微调来说,常见的解法是是继续收集更多等价表述,将改写语句加入训练。对于预训练来说,像 pi 一样经过大规模的数据训练,模型见多了语言任务形式,也能增强指令泛化的能力。但这个论文发现,或许还有一种更简单的解法。本文从模型结构中「L」的设计角度考虑重新思考这个问题。
分析 1:失败动作里,仍然保留着正确任务的结构
为了判断任务信息是否已经消失,论文首先设计了一个动作级检索实验。
对于同一个视觉 Observation,模型先接收当前任务的改写指令,生成一个 action chunk。随后,在完全相同的视觉输入下,再分别输入十个 LIBERO-Goal 任务的原始指令,得到十组候选动作。
接下来只需要判断:改写指令生成的动作,最接近正确任务的原始动作,还是更接近其他错误任务?假如模型已经完全误解了指令,那么改写指令产生的动作不应该稳定地指向正确任务。相反,如果其中仍然包含任务相关信息,它就应该比错误任务更靠近对应的原始动作。
三个模型的 Retrieval@1 均显著高于随机水平 (0.1),Semantic Retention 也全部为正。π0.5 的改写动作尤其明显地靠近正确任务;VLA-Adapter 和 SmolVLA 虽然最终成功率下降较大,但其动作中仍然保留了一定的任务区分结构。
这组结果并不意味着每一个失败 episode 中,模型都已经完整理解了指令。但它至少说明,语言改写并没有让正确任务信息彻底消失。
任务相关信息仍然存在,问题更可能发生在这些信息被转换为连续动作的过程中。
分析 2:逐层替换:语言偏移如何变成动作偏移
上面的实验只能说明任务结构仍然存在。为了进一步判断内部语言特征是否真正控制动作,论文对模型进行了逐层特征干预。
以 VLA-Adapter 为例,同一个 episode 分别使用原始指令和改写指令运行,两次运行中的视觉输入、机器人状态、初始环境以及动作生成条件全部保持一致。在改写指令进入最后一个 Bridge-Attention block 前,实验不改变 image token,也不改变 state token,只将该位置接收到的语言特征替换为原始指令对应的语言特征。
结果显示:
预测动作之间的差异恢复了 96.8%;
配对闭环成功率从 60% 提升至 96%。
替换具体层带来的恢复效果热力图 这说明,改写指令并没有让模型进入一个完全无关的状态。更接近实际情况的是:原始指令和改写指令之间产生了一定的语言表示偏移,而下游 Action Expert 对这种偏移非常敏感,最终将较小的特征差异放大成了不同的机器人动作。为了确认这一位置确实参与任务控制,论文还进行了 wrong-task intervention:将语言特征替换成另一个错误任务的特征后,模型生成的动作会向被注入的错误任务偏移。
不过,这并不是所有 VLA 的共同特征。
在 VLA-Adapter 中,最后一个 Bridge-Attention block 的单层替换就能恢复 96.8% 的动作差异;而在 SmolVLA 和 π0.5 中,对任意单层进行相同替换,最高只能分别恢复约 10.5% 和 31.3%。
这说明三类架构处理任务语义的方式并不相同: VLA-Adapter 将语言信息送入相对独立的 Bridge-Attention policy,控制位置较为集中;SmolVLA 和 π0.5 则在多层多模态计算中持续融合语言、视觉和状态,任务信息更加分散。
因此,语言泛化问题不能简单概括为「所有 VLA 的 Action Head 都在某一层失效」。不同架构的信息流不同,语义修复的位置也需要随之变化。
分析 3:两项控制实验:动态图像与措辞都会扰动语言表示
在确认语言特征差异会影响动作后,论文继续追踪这些差异是如何产生的。分析主要围绕 VLA-Adapter 的辅助 Qwen 分支展开。该分支同时接收当前图像和任务指令,因此语言 token 并不是由文本单独编码得到,而是在视觉 — 语言联合建模过程中产生。
第一项实验用于隔离动态视觉输入对语言表示的影响。模型进行两次前向。第一次前向中,Qwen 接收真实图像和任务指令;第二次前向中,Qwen 接收相同指令,但图像被替换为一张固定图像。随后,第二次前向产生的语言 token 被送回第一次前向的计算路径,而机器人的主视觉分支仍然使用真实 Observation。
也就是说, 机器人依旧能够看到当前场景,只是不再让任务语言表示随着辅助 Qwen 分支中的动态图像共同变化。