登录

MIT给VLA加“外挂”,让机器人边思考边行动,还能回击乒乓球、打地鼠


速读:视觉—语言—动作模型(VLA)已经能够完成不少复杂的机器人任务,但在实际运行中,机器人通常需要先停下来等待模型生成一组动作,再依次执行,完成后才能开始下一轮推理。 加入4个控制步的推理延迟后,VLASH的平均成功率仍达到81.7%,普通异步方法只有51.2%。 这些结果表明,VLASH不仅减少了动作之间的等待,也缓解了异步推理造成的状态错位,让机器人能够更快、更连贯地完成动作。
2026年07月29日 20:46

视觉—语言—动作模型(VLA)已经能够完成不少复杂的机器人任务,但在实际运行中,机器人通常需要先停下来等待模型生成一组动作,再依次执行,完成后才能开始下一轮推理。这种“想完再动”的方式容易造成动作停顿;执行期间,机器人也无法及时根据环境变化调整计划,因此很难应对乒乓球等快速、动态的任务。

异步推理为解决这一问题提供了思路:让机器人“边动边想”。在执行当前动作的同时,模型在后台提前计算下一组动作。一旦推理完成,机器人可以直接无缝衔接执行,从而减少停顿并加快响应速度。

但简单的异步推理也有一个问题。模型开始计算时,机器人还在原来的位置;等计算完成时,机器人和周围环境已经发生变化。新动作依据的是较早的状态,却要在新的状态下执行,因此容易出现动作错位、抖动甚至控制失败。

近日,来自麻省理工学院、英伟达、清华大学、加州大学伯克利分校、加州大学圣地亚哥分校和加州理工学院的研究团队,更新了一项名 为 VLASH 的通用异 步推理框架的研究,MIT  电气工程与计算机科学系的终身副教授 韩松也参与了该项目。

图 | 韩松(来源:MIT) VLASH 要解决的,正是这种预测与执行之间的时间错位。 它的核心机制在于:让模型不再根据机器人“现在的位置”规划动作,而是根据动作真正开始执行时的位置进行规划。

推理开始时,系统已经知道机械臂接下来将执行哪些旧动作,因此可以根据当前关节状态和这些动作,把机器人状态向前推演,估计推理结束时机械臂将到达的位置。模型接收到的仍是当前摄像头画面,但身体状态被替换为预计的“未来状态”。

这一过程不需要额外运行一个大型预测模型。对于使用增量动作的机器人,只需累加推理期间将要执行的动作;对于输出绝对位置的模型,则可以直接使用这段动作结束时的目标状态。

不过,研究人员发现,仅在部署时把未来状态交给 VLA 还不够。许多模型虽然接收机械臂的关节状态,实际生成动作时却更依赖摄像头画面。

为此,VLASH 在微调阶段加入了时间偏移训练:同一张图像分别与当前状态、稍后的状态和更晚的状态配对,并对应不同的目标动作。由于画面保持不变,模型必须学会读取机械臂状态,才能判断应该输出哪一段动作。

为了提升训练效率,团队还设计了共享观察机制。多个时间偏移分支可以共用同一组图像和语言信息,避免了对相同视觉特征的反复编码。实验显示,在同等有效批大小下,VLASH 单个训练步骤耗时约 129 毫秒,而普通微调约需 421 毫秒。

采用 VLASH 后,机器人在反应速度上实现了质的飞跃。论文显示, 在不同硬件平台上,VLASH 将最坏情况下的反应延迟最高降低了 11.8 倍。 具体来说,在 H100、RTX 5090 和 RTX 4090 上,VLASH 的最大反应延迟分别为 46.4 毫秒、58.8 毫秒和 64.6 毫秒;同步推理则分别达到 546.4 毫秒、558.8 毫秒和 564.6 毫秒。

研究团队在模拟环境中测试了接球、投掷和平衡物体等动态任务。这些任务要求机器人根据物体位置随时调整动作,一旦反应慢,或者前后动作衔接不上,就容易失败。加入 4 个控制步的推理延迟后,VLASH 的平均成功率仍达到 81.7%,普通异步方法只有 51.2 %。

在另外 40 项常见操作任务中,机器人需要按照指令移动、识别和摆放不同物体。采用 VLASH 后,π₀.₅ 和SmolVLA 的整体成功率与同步推理基本相当,说明提高反应速度没有明显损害模型原有的操作能力。

(来源:YouTube)

真实机器人测试包括抓取放置、方块堆叠和颜色分类。抓取和分类对动作精度的要求相对较低,VLASH 可以合并部分细小动作,在基本保持成功率的同时将速度提高约 2 倍。方块堆叠需要更精确地对准,因此采用了较为保守的动作量化,加速幅度约为 1.5 倍。

团队还测试了打乒乓球和打地鼠。乒乓球测试中,由人向机器人发球,机械臂需要判断来球位置并及时挥拍。 在 20 次测试中,同步推理、普通异步和 RTC 均未击中来球,VLASH 成功回击 11 次,命中率为 55%。

打地鼠测试中,机器人需要快速击打随机亮起的目标。同步推理的平均得分为 3.2,普通异步为 8.6,RTC 为 11, VLASH 则达到 28.8。

这些结果表明,VLASH 不仅减少了动作之间的等待,也缓解了异步推理造成的状态错位,让机器人能够更快、更连贯地完成动作。

值得一提的是,该团队曾于 2025 年 11 月首次发布这项研究,此次更新主要完善了实验设计、模型覆盖和评价方式。

与最初版本相比,新版不仅加入了 GR00T N1.6 的真机测试,还补充了与同期相关研究的系统性对比。在操作实验的设计上,由先前的 16 轮、部分得分制,严格调整为每项任务测试 20 轮,并按实际完全成功的次数计算成功率,同时给出了统计误差。此外,新版论文修正了反应延迟的计算方式,采用了更严谨的最坏情况定义,将反应速度的提升倍数由早前的 17.4 倍调整为更具参考价值的 11.8 倍。

未来,研究人员希望将 VLASH 与世界模型结合,在估计机器人未来位置的同时,进一步预测环境将发生怎样的变化,从而应对更复杂的动态任务。

参考链接:

1. https://arxiv.org/pdf/2512.01031

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

主题:动作|机器人|模型|状态|推理|异步推理