让VLA真正跑上机器人:北大团队开源Jetson-PI,Jetson Orin控制频率提升8.66倍
在搭载 RTX 4090 的工作站上运行 Vision-Language-Action(VLA)模型,已经不算一件特别困难的事。
但真正困难的是: 如何让几亿乃至数十亿参数的 VLA 模型离开工作站,跑进机器人的机身里,并且保持足够快的反应速度?
对于移动机器人而言,依赖外接高端 GPU 并不是理想方案。一方面,高功耗计算设备会显著压缩电池续航,缩短机器人的工作时间,将机器人应用限制在实验室 Demo 中;另一方面,机器人与计算设备之间的通信还会引入额外延迟,并限制机器人的活动范围。
但如果直接把 π0、π0.5 这样的 VLA 模型部署到机载计算设备(如 NVIDIA Jetson Orin)上,问题同样明显。π0.5 在 Jetson Orin 上完成一次推理大约需要 1.4 秒,对应控制频率仅约 0.7 Hz。 机器人不仅动作迟缓,还可能因为推理延迟,在连续动作块之间出现明显停顿。
图 1 不同计算设备的功耗、机器人续航与 VLA 控制频率对比。高端 GPU 能够提供更低的推理延迟,但会显著增加功耗;Jetson Orin 等端侧设备功耗更低,却面临控制频率不足的问题。
针对这一问题,来自北京大学、AIRS 与 PrimeBot Research Institute 的研究团队提出了 Jetson-PI :一套面向低功耗端侧设备的 VLA 实时控制方案。
Jetson-PI 没有简单地继续压缩模型,而是同时从异步推理算法、模型调度和底层推理引擎三个层面入手。在 NVIDIA Jetson Orin 上,它在不损失模型准确率的前提下,将控制频率从 0.70 Hz 提升至 6.06 Hz,相较原生 PyTorch 推理提升 8.66 倍。
这一突破或许意味着,具身智能正在经历从实验室 Demo 到工业级应用的关键跃迁: Jetson-PI 通过持续、实时且高效的端侧推理,延长机器人的有效工作时间,让 VLA 从「能够演示」走向「能够长期工作」。

论文标题: Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference
论文地址:https://arxiv.org/abs/2607.12659
异步推理代码:https://github.com/PKU-SEC-Lab/Jetson-PI
端侧推理引擎:https://github.com/PKU-SEC-Lab/Jetson-PI-Edge
端侧 VLA 的难题,不只是「推理太慢」
在传统的同步推理模式下,机器人必须等待模型生成完整动作块,才能开始执行。端侧设备的算力和内存带宽有限,推理延迟会直接表现为机器人的长时间停顿。一种自然的解决办法是异步推理:机器人执行当前动作块的同时,模型并行预测下一个动作块。
这样虽然能隐藏一部分推理时间,却会引入两个新问题。
第一个问题是 感知与执行错位 。模型预测下一个动作块时,使用的是推理开始时采集的图像。但当推理结束、动作真正开始执行时,机器人和外部环境早已发生变化。推理延迟越长,模型「看到的环境」和动作「发生的环境」之间的偏差越大。对于端侧推理而言,错位问题会更加严重。
第二个问题是 反应时间过长 。即使推理和动作执行实现了并行,机器人对环境变化的响应速度仍然受完整 VLA 推理延迟的限制。在 Jetson Orin 这类端侧设备上,一次推理可能超过 1 秒,机器人很难及时应对复杂操作中的物体滑动或位置变化。
以往的异步推理方法尝试在时间维度上融合新旧轨迹,从而提升轨迹的平滑度。然而,其动作预测过程仍然存在以上两方面的问题。当部署于边端的 VLA 模型执行叠衣服等复杂任务时,可能会因动作误差而导致任务失败。
Jetson-PI 因而选择了一条不同的路线:不对新旧轨迹进行融合,而是直接预测未来的环境表征,从未来时刻开始预测动作。
图 2 同步推理、朴素异步推理和 Jetson-PI 的执行方式对比。朴素异步推理虽然消除了动作块之间的停顿,却会产生预测—执行错位;Jetson-PI 通过未来修正缓解这一问题。
不预测未来图像,而是修正未来表征
Jetson-PI 的核心方法被称为 Foresight-Aligned Asynchronous Correction,即「前瞻对齐异步修正」。
研究团队训练了一个轻量级未来修正模块。该模块接收两类输入:当前时刻由 VLM 生成的环境表征,以及已经提交给机器人、即将执行的动作序列。在此基础上,它预测这些动作执行完成后,环境在未来时刻对应的 VLM 环境表征。动作专家不再只依据过时的当前观测来预测动作,而是能够从预计的未来时间点开始生成动作序列。
这里有一个关键设计:Jetson-PI 没有尝试生成完整的未来图像,也没有逐层修正 VLM 的全部 KV Cache。前者计算成本过高,后者同样会引入大量额外推理。Jetson-PI 只压缩并预测 VLM 最后一层的环境表示,再把修正信息送入动作专家。整个未来修正模块约有 40M 参数,仅占完整 VLA 模型参数量的约 1%,因此不会给端侧设备带来过大的额外负担。
为了让该模块同时适应不同硬件和不同推理延迟,训练过程中会随机采样未来时间跨度。无论模型部署在 Jetson Orin、Jetson Thor,还是性能更高的 GPU 上,同一套修正模块都可以根据实际延迟调整预测的时间范围。
图 3 前瞻对齐异步修正框架。未来修正模块根据当前压缩环境表征与已提交动作,预测推理完成时的未来环境表征,再由动作专家生成与未来执行时刻对齐的动作。
预测动作,并不需要每次都运行整个模型
引入未来修正后,理论上,完成一次 VLM 环境观测后,系统只需反复调用未来修正模块和动作专家,就能持续生成后续动作。这样可以避免每次生成动作时都重新执行耗时的视觉—语言推理,从而提高机器人的控制频率。然而,由于未来修正模块存在误差,如果长期只依赖未来修正,误差累积会导致动作预测错误。
研究团队重新分析了 VLM 和动作专家在机器人控制中的分工:VLM 的主要作用是重新观察当前环境,校正系统对外部世界的理解;动作专家则负责高频生成动作。
Jetson-PI 因而提出了 基于置信度的调度机制 。在未来修正模块预测未来环境表征的同时,也输出预测表征的置信度。当未来修正模块给出的置信度高于阈值时,系统跳过 VLM,直接使用修正后的环境信息调用动作专家。由于动作专家推理更快,机器人可以更频繁地生成新动作。当置信度下降至阈值以下时,系统重新调用 VLM,读取最新的摄像头画面,并刷新环境表征、KV Cache 和后续预测所需的状态缓存。
实际测试案例显示,在动作平稳、环境变化容易预测时,置信度通常保持较高;而在抓取、接触和放置等关键步骤中,置信度会明显下降,触发 VLM 重新观察环境。
这相当于让机器人学会判断:「什么时候可以凭借已有认知继续行动,什么时候必须重新看一眼。」
图 4 Jetson-PI 的置信度调度机制。当未来预测置信度较高时,系统跳过 VLM,直接调用动作专家;在抓取和放置等环境变化较难预测的阶段,置信度下降并触发 VLM 更新。
基于 llama.cpp,重做一套端侧 VLA 推理引擎
算法解决了「何时调用模型」的问题,但要让 π0、π0.5 真正达到端侧实时控制要求,底层推理系统同样需要优化。研究团队基于 llama.cpp 开发了 Jetson-PI-Edge,并针对 VLA 的执行特点进行了三项核心优化。
1)计算图复用。 传统语言模型的输出长度会随解码过程不断增长,计算图形态会动态变化。VLA 推理则有所不同:当摄像头数量、图像分辨率和动作维度固定时,大部分输入张量的尺寸也是固定的。语言指令虽然长度不同,但通常较短,可以通过 padding 统一到固定长度。Jetson-PI-Edge 因而在第一次推理时构建 CUDA Graph,之后直接复用,避免每轮控制都重复建图。
2)常驻中间缓存。 视觉编码器、语言模型和动作专家之间需要传递视觉 embedding、KV Cache 等中间结果。通用推理框架会将这些结果写回 CPU 内存,再由下一个模块重新复制到 GPU。对于内存带宽有限的端侧设备,这类往返传输会产生明显开销。Jetson-PI-Edge 为固定尺寸的中间结果预留 GPU 缓冲区,使 ViT、LLM 和动作专家可以直接复用 GPU 上的数据。
3)Flow matching 展开。 π 系列模型的动作专家需要执行多轮 flow matching 去噪。若每一步都单独调用计算图,会产生重复的调度和 kernel launch 开销。Jetson-PI-Edge 将多轮去噪展开到统一的计算图中。虽然第一次建图的成本会增加,但之后可以持续复用,因此更适合机器人长时间运行的控制循环。
在计算图复用、GPU 中间缓存和 flow matching 展开全部启用后,π0.5 在 Jetson Orin 上的单次推理时间降至 412.9 ms,其中动作专家的推理时间从 536.8 ms 降至 123.1 ms。结合置信度调度后,系统反应时间进一步降至 165.1 ms,控制频率达到 6.06 Hz,相较原生 PyTorch 框架提升 8.66 倍。
值得注意的是,系统加速并不是以量化或剪枝为前提。论文中的计算图复用、缓存和展开优化没有改变模型计算本身,理论上还可以与量化、剪枝等方法组合,进一步降低延迟。
图 5 Jetson Orin 上不同优化阶段的延迟、反应时间和控制频率。Jetson-PI 在 Orin 上将控制频率从 0.70 Hz 提升至 6.06 Hz。
延迟越长,未来环境修正越重要
在 LIBERO 的 Spatial、Object、Goal 和 LIBERO-10 四个子数据集上,团队使用 π0.5 对 Jetson-PI、RTC 和 VLASH 进行了比较。在不同异步延迟设置下,Jetson-PI 相比 VLASH 的平均成功率高出 14.8 个百分点,相比 RTC 高出 3.9 个百分点。
随着延迟增大,只预测未来机器人状态的 VLASH 性能明显下降。Jetson-PI 则通过预测未来环境表征,在较长延迟下保持了更加稳定的成功率。以延迟步数 Δ = 9 为例,Jetson-PI 在四个数据集上的平均成功率相较 VLASH 高出 45.6 个百分点,相较 RTC 高出 7.0 个百分点。
这组实验说明,端侧 VLA 的问题并不只是「把推理做快」。当推理延迟无法完全消除时,还需要让模型理解:在这段延迟时间内,机器人执行的动作会怎样改变未来环境。
图 6 Jetson-PI、RTC 与 VLASH 在四个 LIBERO 子数据集及不同异步延迟下的成功率。随着延迟增大,Jetson-PI 的性能更加稳定。
真实机器人完成衣物折叠
研究团队还在 PrimeBot Research Institute 的 X2-W 机器人上进行了真实场景实验。
机器人配备一个头部摄像头和两个腕部摄像头,图像分辨率均为 224 × 224。团队将包含衣物拾取、展开与折叠、整理存放的复杂任务拆分为三个子任务,并以 15 Hz 的频率执行动作。
如图所示,同步推理需要等待完整动作块生成后再继续执行,因此机器人会在动作块之间出现明显停顿,整体执行缓慢。简单异步推理虽然将预测与执行并行起来,减少了停顿,却没有解决感知时刻与动作真正执行时刻之间的偏差,导致动作连续性较差。Real-time Chunking 进一步改善了动作块之间的衔接,但仍然依据已经滞后的环境观测生成动作。在衣物抓取、调整和折叠等对时机要求较高的阶段,感知—执行错位仍可能造成关键动作失败。
相比之下,Jetson-PI 根据已提交动作预测未来环境表征,使新生成的动作与实际执行时刻对齐。图中的机器人运动轨迹更加连续,衣物操作过程更加流畅,同时保持了更高的实时性。
图 7 Jetson-PI 在 X2-W 机器人上执行衣物折叠任务。
Jetson-PI 的定位
Jetson-PI 所关注的,不是继续把 VLA 模型的参数规模推向更高,而是解决一个更接近真实机器人落地的问题:当模型必须在功耗、带宽和散热都受限的机载设备上运行时,如何让它依然具备足够快的反应速度?
这项工作的答案由三个部分组成:用未来环境表征缓解异步推理中的感知—执行错位;用置信度调度减少不必要的 VLM 调用;用面向 VLA 特性的系统优化压缩端侧执行开销。对于强调功耗、续航、活动范围和离线运行能力的移动机器人而言,这套方法提供了一条更加可行的路线:不必把整台高端工作站搬上机器人,也能让 VLA 控制逐步接近实时。
作者介绍
论文第一作者杨泽斌是北京大学人工智能研究院二年级博士生,导师为李萌教授。其主要研究方向为高效具身智能算法与系统、大语言模型高效推理及边缘计算,聚焦算法—系统—硬件协同设计,致力于解决具身智能系统在实际部署中的能效与实时性瓶颈。
他在 NeurIPS、DAC、ICCAD 等 AI 与计算机体系结构顶会上发表多篇一作论文,相关一作工作包括:高效端侧目标导航算法 EfficientNav、具身规划记忆管理系统 KEEP、面向机器人操作的层跳过高效推理框架 DySL-VLA、面向边端信息处理的轻量化语言模型部署系统 MCUBERT,以及面向端侧实时机器人控制的异步推理框架 Jetson-PI 等。