登录

大晓机器人联合香港大学发布StreamPI,重构机器人时序智能


速读:不同于传统VLA主要依据当前观测独立决策,StreamPI为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。
2026年08月28日 16:

【TechWeb】8月28日消息,近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models),直指 VLA 长期存在的“单帧智能”瓶颈,为其补上关键的“时间维度”。不同于传统 VLA 主要依据当前观测独立决策,StreamPI 为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。它推动 VLA 从“识别当前状态”,进一步走向“理解一个正在发生的物理过程”。

更重要的是,StreamPI 并未依赖额外参数堆叠换取时序能力,而是基于现有 VLA 骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现从单帧决策到连续时序建模的轻量化扩展。真实机器人以及 LIBERO、CALVIN 等实验均显示,StreamPI 在时序记忆、精细空间操作与长程连续任务中取得显著提升。StreamPI 所探索的不只是“让 VLA 多看几帧”,而是让机器人开始同时理解空间、时间与状态演化,为具身基础模型从面向单一时刻的瞬时动作智能迈向真正面向动态世界的连续物理智能提供新的技术路径。

VLA 会“看”和“做”,但还需理解“发生了什么”

以 π0、π0.5 为代表的新一代 VLA,正不断拓展机器人在开放环境中的泛化边界。π0.5 已能够在训练未见过的家庭环境中完成厨房、卧室清洁等 10-15 分钟的长程多阶段任务,机器人基础模型正在从单一技能执行走向更复杂的开放世界操作。

基于 VLA 的机器人操作三种范式对比

但 StreamPI 直指 VLA 更底层的能力缺口:当前大量模型仍依赖单帧决策,能够判断“眼前是什么”,却难以持续理解“此前发生了什么”。缺少历史上下文,不仅限制机器人的时序记忆,也使其难以利用运动视差、状态变化等跨帧线索形成更准确的三维空间判断。这也是当前流式感知与实时 VLA 研究持续关注的问题。

一个最直观的例子是“猜杯子”:物体被藏入杯子并经过多次交换后,答案已不存在于最后一帧,而存在于整个变化过程;面对滚动物体,单帧只能判断“它在哪里”,连续观测才能理解“它正往哪里去”。当关键信息存在于时间之中,机器人需要的不只是看见当下,更要理解过程。

不是简单“多看几帧”,而是从窗口式走向流式

给 VLA 加入时间信息,最直接的方法是把过去多帧图像组成一个窗口,一次性交给模型。但历史越长,视觉信息越多,不仅需要反复计算已经处理过的画面,推理开销持续增加,任务指令也更容易被大量视觉信息稀释,导致机器人在长程执行中逐渐“忘记目标”。

StreamPI 没有简单堆叠历史帧,而是将每个时刻组织为一个完整的“视觉观测 + 任务指令”时序单元。语言指令持续绑定每一次观测,成为贯穿任务始终的语义锚点,让机器人在不断接收新信息的同时,始终明确“正在做什么、目标是什么”。

在每个时序单元内部,视觉与语言充分交互;不同时间单元之间,则按照时间顺序持续读取和聚合历史信息。由此,模型既能理解“这一刻看到了什么”,也能追溯“此前发生了什么”,将原本离散的单帧判断连接成连续的时序理解,实现帧内解决“这一刻看到了什么”,帧间解决“此前发生了什么”。

记住过去,但不必反复计算过去

让机器人拥有记忆,并不意味着每次决策都要重算全部历史。StreamPI 采用流式推理(Streaming Inference):首帧观测被编码后存入键值缓存,后续只需处理新到来的信息,并直接调用历史表示,避免重复计算整个观测窗口。

StreamPI 架构示意图

随着机器人持续行动,新信息不断写入、历史信息持续保留,当前决策始终建立在此前状态之上。与此同时,StreamPI 无需额外引入视频编码器或独立记忆模块,而是通过重构原有 VLA 的注意力机制,直接继承 π0.5 的视觉—语言表征能力,在不增加额外模型参数的情况下,让单帧 VLA 获得连续时序能力。

让模型适应真实世界“不整齐”的时间

真实机器人并不会按照理想的固定节奏运行。相机采集、模型推理、通信与机械臂执行都会产生延迟,使真实观测呈现不同程度的时间波动,而只在固定间隔数据上训练的模型,很容易在部署时遭遇时序分布差异。

为此,StreamPI 引入随机时间间隔训练(Random-Interval Streaming Training):随机改变历史观测之间的时间距离,并随机隐藏部分早期信息,让模型适应不同时间跨度和不完整上下文。模型由此学习更稳定的时序关系,而不是依赖特定帧率下的运动模式。

实验显示,在 LIBERO 上,这一策略将三帧输入时的平均成功率从 96.4% 提升至 97.5%,五帧输入时从 97.0% 提升至 98.3%。更大的采样间隔也意味着无需处理相机产生的每一帧,为机器人动作执行留出更多时间;优势在长程任务中进一步放大,其中最依赖长程上下文的 LIBERO-Long,从 π0.5 的 92.4% 提升至 95.0%。在已经接近饱和的高基线上,时序建模依然带来稳定增益。

更考验连续任务能力的 CALVIN 上,StreamPI 平均连续任务长度达到 4.547,超过 π0.5 的 4.313 和 MemoryVLA 的 4.090;任务推进到第五步时,成功率仍达到 85.0%,高于 π0.5 的 79.5%。

真机验证:当“时间”真正改变动作结果

团队进一步设计四项真机任务,分别检验时序记忆与精细空间感知,每项任务采集 100 条人类遥操作示范。在需要持续记住杯子交换轨迹的“猜杯子”(Shell Game)任务中,StreamPI 将 π0.5 的成功率从 46.7% 提升至 80.0%;在需要判断物体运动趋势的滚动物体抓取中,则从 26.7% 提升至 63.3%。差距不在于机器人能否“看见”杯子和瓶子,而在于它能否理解此前发生了什么,以及物体接下来可能去哪里。

真实世界任务可视化与真实机器人性能对比

在强调空间精度的任务中,效果同样明显。在窄瓶口插笔任务中,成功率从 40.0% 提升至 66.7%;纸杯插入杯套任务则从 60.0% 提升至 92.0%。连续观测带来的运动视差、相对位移和状态变化,让机器人获得单帧图像难以提供的几何线索——时间不仅带来记忆,也在帮助机器人更准确地理解空间。

从空间智能,走向时空智能

StreamPI 真正探索的,并不只是“为 VLA 增加历史信息”,而是推动机器人从基于当前状态决策,走向基于连续过程决策:现实世界不再是一组彼此孤立的静态画面,而是一条可以被记忆、理解和持续更新的时间流。

目前,StreamPI 在超长时间跨度训练和极端异步场景下仍有进一步提升空间。未来,团队将探索超过 100 帧的高效时序训练与自适应缓存裁剪,将机器人的时序理解进一步延伸至更长、更复杂的真实任务。

空间告诉机器人“物体在哪里”,时间告诉机器人“世界正在发生什么”。从看见一个瞬间,到理解一段过程;从感知当前状态,到记住过去、理解变化并持续行动——StreamPI 正在为 VLA 补上时间维度,推动具身基础模型从空间智能进一步走向真正面向动态物理世界的时空智能。

主题:理解|让机器人