具身智能开始拼高质量数据了!灵初Psi-R 2.5用强Pair Data重做训练链路
编辑|山辉
两年前,一段机器人炒虾的视频在网上爆火。
视频中的机械臂一手端锅、一手拿铲,把虾翻炒后倒进碗里,看起来已经很像一个熟练的厨房帮手。
但机器人学会这套动作并不轻松。研究人员需要先亲自操控机器人完成任务,反复采集真机示范,再通过模仿学习让机器人逐渐学会独立执行。 对 于一 个固定任务,大约要采集 50 次这样的示范。
如今,灵初智能在相似的任务中,展示了机器人学习的另一种可能。 在这组演示 里 , 人只需要示范一遍,无需重新训练或微调模型,机器人就能把这段操作作为类似 Prompt 的上下文,尝试完成新任务。
人类示范「准备配菜 — 青椒下锅 — 龙虾下锅」三步流程后,Psi-R2.5 通过 In-Context Learning 按顺序复现任务,无需重新训练模型。
同样是炒菜,两年前关注的是机器人「会不会」,现在灵初更关注机器人「 怎么学 」。
对人来说,拿起锅铲,翻动食材,几乎都是下意识完成的。那能不能跳过一遍遍的采集真机数据,直接把人类的操作经验拿来训练机器人?
灵初此前已经在沿着这条路前进。
四月发布的 Psi-R2 和 Psi-W0 将十万小时规模的人类数据用于预训练,并通过 Psi-W0 和强化学习,把人手轨迹进一步优化成机器人能够执行的轨迹。但这意味着,Policy 与 World Model 需要反复 rollout,轨迹还要继续用强化学习微调,整个转换链路依然繁琐。
现在,灵初智能正式发布新一代具身基础模型 Psi-R2.5。
这一次,团队没有继续把重点停留在「十万小时人类数据」上,而是开始处理数据规模起来之后的两个新问题: 哪些数据真正有价值,以及怎样让这些人类数据更顺畅地进入机器人的训练过程。
项目演示与完整技术博客: Scaling Pair Data for Embodied Intelligence
https://www.psibot.ai/scaling-pair-data-for-embodied-intelligence-zh/
在数据转换方面有一个关键变化, 既然从人类数据到机器人数据的转换很麻烦,能不能反过来,先从本来就能执行的真实机器人数据出发?
答案落在了 Pair Data 上。
Scaling Pair Data:
让人类数据真正进入机器人训练
为什么不能直接把人类视频拿来训练机器人?核心还是 Embodiment Gap。
一方面,人手和机械手在视觉上存在差异,相机参数、环境变化等也会带来 Visual Embodiment Gap ;另一方面,人类 action 与真实机器人数据之间还存在手部姿态估计、关节结构带来的运动学误差,以及摩擦力等物理参数误差,也就是 Dynamic Embodiment Gap 。
前面提到,上一代 Psi-W0 已经能够将人手轨迹优化成可执行的机器人轨迹,但每条数据仍需要经过 World Model rollout 和强化学习微调。
Psi-R2.5 改变了 Pair Data 的构建方式。
灵初把只按照相同任务语义收集的数据称为「 弱 Pair Data 」;如果图像上除本体外基本一致、时序上逐帧对应,同时 action 可以直接在机器人上 replay,则称为「 强 Pair Data 」。
强 Pair Data
弱 Pair Data
团队从真实机器人数据出发,逆向生成对应的人手数据。
这一步很有意思:最终明明是要把人类数据转成机器人数据,为什么先反过来生成一遍人手数据?
关键在于,真实机器人数据本身已经包含可以直接使用的图像和 action。团队从这些机器人数据出发,生成与之一一对应的人手数据,就先得到了一批成对的人类 — 机器人数据。
有了这批强 Pair Data,团队进一步训练了带 action 的端到端人类数据到机器人数据转换模型,让新的人类操作数据可以直接与机器人数据对齐。
那要怎么验证转换有没有用?一是可以把转换后的机器人数据直接放到真机上 replay;二是拿这些数据继续训练模型。
最终,人只需要用普通手机或相机拍下一段操作视频,就可以通过这套 pipeline 将其转换成不同机器人的数据。
相比上一代,这一次真正缩短了「拿到一段人类数据」和「得到机器人真正能用的数据」之间的距离。
从人类示范到真实任务,
只要 1—2 个工作日
但把人类数据转换成机器人能够使用的数据,只解决了「怎么学」的问题。
面对具体场景,机器人还需要处理任务步骤和现场环境等一系列的变化。
因此,Psi-R2.5 在模型结构上也做了调整。
相比上一代 Psi-R2 和 Psi-W0 两个模型分别承担不同功能, R2.5 采用了双层架构:上层负责长程任务拆解,把一段长 instruction 分解成对应的 subtask;下层再结合当前观测,输出机器人具体的操作轨迹。 其中,上层模型以 QwenVL3.5-4B 为骨干,下层则使用 Wan2.2-IT2V-5B,两者通过同一批预训练数据进行训练。