无本体数据直达真机,深朴智能拔掉机器人后训练的「真机数据锚点」
编辑|Youli
当下,一个逐渐清晰的共识是,具身智能的叙事正由「会不会做一个动作」,转向「能不能在真实世界里稳定完成复杂任务」。尤其是在刚刚过去的 WAIC2026 现场,这一点尤为明显,机器人不再满足于表演式的单动作演示,而是被期待走进产线、仓储和酒店客房,真正「做事」。
不过,Demo 与落地之间,隔着一道明确的鸿沟。VLA 还是 WAM?模型够不够大?参数够不够多?等等,路线之争尚无定论。但有一个难题明确而具体: 数据,尤其是高质量操作数据。
前段时间,「AI 教母」、斯坦福大学教授李飞飞再次重申这一难题,直言, 不同于 LLM 可以从互联网上获取丰富数据资源,具身智能从训练到评估阶段,数据都十分匮乏……

仔细来看,目前行业中的几大数据来源各有优劣。
互联网视频规模大,但缺少精确动作信息;真机遥操数据足够准确,却需要同时占用机器人、操作员和固定场地,成本高,扩展速度也慢;UMI 等无本体采集方案提供了另一条路径,把采集设备从机器人身上拆下来,解决了进入更多真实环境的问题。
可过去很长一段时间里, 这类无本体数据由于保真度缺陷,主要用于模型预训练,到了学习具体任务的后训练阶段,团队仍要补充一定比例的真机遥操作数据,作为「锚点」, 对齐机器人本体、执行时延、相机视角和真实环境差异。
行业普遍做法,是不断降低这部分真机遥操作数据的占比,缩小「锚点」,可只要「锚点」仍然存在,就意味着无本体数据始终无法独立完成从训练到部署的闭环。
有没有另一种可能: 与其继续压缩真机数据,能否提高无本体数据本身的保真度,让「锚点」失去必要性?
这就是深朴智能推出 HiFi-UMI 的出发点。
近期, 深朴智能发布高保真无本体数据生产引擎 HiFi-UMI, 将便携式采集设备、轨迹重建、数据治理、模型训练和真机部署连接起来。
实验中,后训练阶段仅使用 HiFi-UMI 示范,策略便能部署到真实机器人上。在 VLA 与 WAM 两类架构的三个代表模型中,整体成功率达到同域真机遥操作数据的相近水平。与此同时,使用同一批语料进行大规模预训练后,模型在十个未见任务上的平均动作预测误差进一步下降了 41%。

这意味着, 无本体数据开始从一种用于扩充预训练语料的数据源,继续走向任务后训练和真实机器人执行……

论文链接:https://arxiv.org/pdf/2607.25895
项目主页:https://cloud.simpleai.tech/simple-world-lab/hifi-umi/
开源数据集:https://huggingface.co/datasets/simple-world-lab/HiFi-UMI-2K
「无本体数据」,为什么一直停在预训练阶段?
其实,长期以来,UMI 数据被挡在后训练「门外」,不是行业偏见,而是有着真实的技术局限性。
首先要承认的是, UMI 确实解决了机器人操作数据最直观的规模问题。
真机遥操作要求机器人、操作员和任务环境同时在线,每次操作失败后,物体需要重新复位,机器人需要恢复初始状态,硬件还可能出现磨损和故障。随着采集规模扩大,设备调度、人员管理和场地维护都会成为新的成本。
而 UMI 类无本体采集将人类示范与机器人硬件解耦, 把采集设备从机器人身上拆下来,不需要操控一台真实机器人,只需携带便携设备进入家庭、酒店等场景,就能记录人类完成擦拭、整理、折叠和搬运等操作,由此摆脱机器人数量限制,可以进入更多真实环境。
但规模大,并不代表数据已经能够直接驱动机器人。因为 预训练和后训练,对数据的要求并不相同。
预训练阶段,模型可以从数据中学习手应该靠近哪个物体,一项任务通常包含哪些步骤,抓取之后大致应该朝哪个方向移动。而到了后训练阶段,要求会明显提高,机器人需要知道末端应该落在哪个具体位置,两只手应该保持怎样的距离和角度,夹爪应该在哪一帧闭合,发生接触后又该如何继续移动。
毫米级的误差不会妨碍模型理解「将遥控器放入槽位」,却足以导致「真实插入」的失败。
因此,无本体数据从预训练走向后训练,核心挑战就在于 数据够不够保真?
而传统 UMI,存在明显的四大保真度方面的局限性:
轨迹漂移: 位姿依赖腕部在线视觉 SLAM,操作过程中视角频繁被手部或物体遮挡,长时程任务中,轨迹漂移问题严重;
双手「各说各话」: 双手相对位姿通过跨相机共视重建,而非原生测量,协调任务误差大;
时间不同步: 相机、夹爪编码器和位置传感器往往来自不同设备,靠软件或无线对齐,过程中模型可能会把视觉状态与错误动作对应起来,存在毫秒级时差,而在快速移动、夹爪闭合和物体接触的瞬间,这种错位会直接影响策略学习;
视野盲区: 单只手仅一个鱼眼相机,视野盲区大、深度线索弱,模型看到了动作开始和结束,却未必看清中间发生了什么。
这些问题共同限制了传统 UMI 数据的能力边界: 它可以帮助模型形成通用操作经验,却很难独立承担对精度要求更高的任务后训练 。
破局:HiFi-UMI 软硬件协同、「四重保真」
深朴智能认为,既然保真度不够,那就想办法啃下这块「硬骨头」。为此,深朴智能没有基于旧流程进行修补,而是围绕「轨迹精度、双手位姿、时间同步、视野覆盖」四个维度,对采集硬件和数据处理进行了系统性重构。
头戴式双目惯性 SLAM,求解原生相对位姿
传统 UMI 通常把视觉定位的主要视角放在手腕上,而 HiFi-UMI 将定位基准转移到了相对稳定的头部,采用头戴式双目相机与惯性测量单元(IMU),通过离线双目惯性 SLAM 重建头部轨迹。
同时,左右手分别安装视觉标记结构,由头部双目相机在统一坐标系中同步定位,这样,两只手的相对位姿在采集过程中直接形成,不需要先分别重建两条轨迹,再进行事后拼接。

结果是,在手写轨迹实验中, HiFi-UMI 可以重建毫米级笔尖运动,工作空间内末端轨迹误差约为 3 毫米, 全程不依赖外部动捕或定位设备。
时间层面的对齐:统一 GPIO 硬件同步,消灭跨传感器偏差
传统方案的毫秒级软件同步,在这里,HiFi-UMI 使用 统一 GPIO 硬件触发器 取代,六路相机、IMU 和夹爪编码器被同一根「神经」驱动,跨传感器间时间同步误差压缩到 40 微秒 以内。
机器人策略学习的是,在某个视觉和状态输入下,应该输出什么动作。如果图像、手部位姿和夹爪状态没有严格同步,训练样本中的状态与动作就会发生错位。微秒级硬件同步让视觉、轨迹和夹爪状态尽可能对应同一个物理时刻。
6 路视觉协同:全局定位与局部感知互补
视觉覆盖方面,HiFi-UMI 在每只手上配置上下两枚超广角鱼眼相机,再加上头部双目,共形成 6 路视觉输入。
头部视角提供完整的全局观察,记录环境、目标物体和任务进度;腕部视角靠近夹爪和操作区域,负责捕捉接触、抓取和物体局部变化。 单腕水平和垂直视角均约 200° , 当目标物体在某一路视频中受到遮挡时,其他视角仍可能保留关键操作信息。系统可以据此识别操作对象、判断任务进度、确定动作边界,也能为轨迹检查、失败分析和 AI 辅助标注提供更多依据。
全掌手套,让操作更「像人」
此外,值得一提的是,HiFi-UMI 还采用 全掌手套式夹爪, 兼顾小物体精细操作和较大物体抓取。采集者能够采用更接近自然抓取和发力的方式完成示范,减少设备结构对动作习惯的干扰。
不过,采集只是开始,高精度设备只能保证原始信号质量,一次人类示范要变成模型可用的数据,还需要经过完整的数据治理流程。
当数据采集完成后,要依次经过 轨迹重建与清洗、仿真重定向、AI 辅助标注、人工复核和分析导出等步骤。

轨迹重建与仿真回放的通过率均约为 98%,仿真回放可以提前检查动作是否超出机器人工作空间,双臂是否发生碰撞、夹爪状态是否合理,以及整段操作能否连续执行等,两道关卡串联后,原始采集数据的基础有效率约为 96%。
最终,每段有效示范都会保留同步多视角视频、双手轨迹、夹爪状态、语言描述、子任务边界和质量记录。
而到这里, HiFi-UMI 也正式从一套采集设备,变成一套完整的数据生产引擎。
真正的考验:能否「直达真机」?
数据采得更准,只解决了数据生产问题。真正的考验是,机器人能否仅凭这些数据把任务做完。也就是说, 在目标任务的后训练阶段,完全不补充真机遥操作数据,训练后的策略能否在真实机器人上完成任务?
为了回答这一问题,团队在双臂真机平台上设置了四项任务。
污渍擦拭: 机器人需要让清洁工具持续接触桌面,并按照合理轨迹覆盖目标区域。这类任务考验持续接触、运动连贯性和轨迹控制 —— 机器人即使能够抓住工具,也未必能够维持稳定接触并覆盖完整区域;
衬衫折叠: 柔性物体没有固定形态,机器人每完成一步,衣物的褶皱、边缘和位置都会发生变化,两只手还要相互配合,维持张力,完成对齐和翻折,考验的是机器人双手相对位姿和长程动作稳定性;
遥控器插入: 这是典型的约束放置任务,机器人需要准确判断槽位位置和方向,并将遥控器调整到合适姿态,几毫米的平移误差或微小的角度偏差,都可能导致插入失败;
果蔬分类: 机器人需要用右手将蔬菜放在粉色盘子里,用左手将水果放在蓝色盘子里,它同时考验指令遵循、视觉理解、和双臂操作。

整体来看,四项任务的设置分别涉及 「持续接触、柔性物体操作、精密放置和指令遵循」, 避免实验结果只来自简单抓取或固定物体搬运。
实验选取了三个代表模型,分别是 StarVLA-QwenPI、OpenPI-π0.5——VLA 模型;LingBot-VA——WAM 模型。
三套模型采用不同的技术路线,也是为了让 HiFi-UMI 的验证不再局限于某一个专门定制的策略架构,将数据源效应与模型架构效应分离。
在同一个模型内,实验仅更换后训练数据来源,一组使用真机遥操作数据,另一组只使用 HiFi-UMI 示范。
需要注意的是, 两类数据面对的场景条件并不相同。 真机遥操作基线直接采集自最终评测环境。模型在训练中已经见过相同的桌面、背景、光照、相机视角和物体分布。而 HiFi-UMI 示范来自不同地点、背景和光照没有任何一条 HiFi-UMI 轨迹在最终评测现场采集。
因此可以说,真机遥操作基线因此拥有明显的同域数据优势,HiFi-UMI 策略除了学习任务动作,还需要跨越额外的环境与视觉分布差异。
不过从结果来看,即便在如此「不对等」条件下,HiFi-UMI 数据依旧取得了好成绩。
下图是 HiFi-UMI 与真机遥操作数据在两种 VLA 模型上的后训练效果对比,每个任务 — 策略组合均进行 40 次真机评测,汇总结果覆盖四项任务、每个策略需进行 160 次真机评测。

StarVLA-QwenPI 使用两类数据后的整体成功率分别为 51.3% 和 53.8%,即使用 HiFi-UMI 后训练,160 次评测中成功 82 次,而使用遥操作后训练,160 次评测中成功 86 次,仅相差 - 2.5%。
而 OpenPI-π0.5 基于 HiFi-UMI 和真机遥操数据后训练的整体成功率分别为 77.5% 和 74.4%,使用 HiFi-UMI 后训练要比遥操作后训练高出 3.1%。
同样,在 WAM 模型 LingBot-VA 上,HiFi-UMI 后训练与真机遥操作后训练的整体成功率分别为 56.9% 和 57.5%,差距仅 - 0.6 个百分点; 而在污渍擦拭和果蔬分类任务上,HiFi-UMI 后训练分别取得 62.5% 和 57.5% 的成功率,均略高于真机遥操作后训练。

其实,这组实验结果的关键并不只是成功率数字本身,而是说明, 高保真无本体数据已经可以同时提供任务语义、视觉观察、精确轨迹、双手关系和执行时序。
换句话说,HiFi-UMI 开始具备独立承担目标任务后训练的能力。
不仅如此,除了替代真机后训练数据, HiFi-UMI 还能作为大规模预训练数据。
团队使用 4000 小时 多任务 HiFi-UMI 数据,对 StarVLA-QwenPI 进行预训练。
结果显示, 在 10 个没有参与训练的任务上,预训练模型的平均动作预测误差下降 41%。 完成预训练后,团队继续使用 HiFi-UMI 数据进行专项后训练。 四项真机任务的平均成功率进一步提高了 18.1%。
在这套训练体系中,预训练和后训练承担不同作用。预训练帮助模型积累跨任务的视觉 — 动作经验,学习抓取、移动、对齐、放置和双手协作等通用交互模式;后训练再通过高精度专项示范,让模型适应具体物体、任务步骤、动作位置和终止条件。
而随着数据量增加,模型在保留集上的动作预测误差整体下降 61%,并呈现清晰的幂律下降趋势,其中,α 为 0.268,R² 达到 0.993。

这一结果还不足以证明具身智能领域已经形成普遍适用的 Scaling Law,却至少说明,在当前 4000 小时数据范围内,模型的动作预测误差能够随着高质量 UMI 数据增加而稳定下降。
而单任务实验则进一步展示了预训练对于数据利用效率的提升。
如下图左侧所示,在遥控器插入后训练任务中,使用 400 条示范时,模型成功率为 37.5%,增加到 800 条后成功率升至 65%,1600 条则对应 70%,3200 条达到 85%。之后数据量继续增加到 6400 条时,成功率没有继续提升,这说明, 单一任务中的后训练数据收益,在数据达到一定程度后会逐步饱和。 而经过多任务预训练的模型, 只使用 800 条遥控器插入专项数据,就超过了未经预训练、使用 3200 条专项数据的版本, 这大幅度地提升了数据后训练效率。

不仅如此,在十项未参与预训练的任务上,预训练模型的表现还呈现出清晰的分层:餐具、餐盘一类的刚性抓放任务改善最快,颗粒物转移居中,而衣物折叠改善最慢。对照预训练数据的构成,原因并不难解释 —— 物体与容器的放置类动作占据了预训练帧数的三分之一以上,而织物折叠的占比不足百分之一。面对没见过的餐具,模型可以复用大量刚体抓放经验;而衣物折叠只能从稀疏的可形变物体监督中做外推。

这揭示一个有趣的发现: 模型迁移能力并不取决于「是否见过这个物体」,而是取决于「预训练是否覆盖过这类物理交互」。 因此,具身数据集的建设不能只统计任务数量和物体类别,底层交互模式、状态变化和失败分支的覆盖程度,同样会决定模型能够学到什么。
整体来看, HiFi-UMI 的价值覆盖了机器人学习的两个关键阶段: 在预训练阶段积累可复用的视觉 — 动作经验;在后训练阶段帮助模型快速掌握具体操作并直接部署。 如果说后训练证明了 HiFi-UMI 的「可用」,那么大规模预训练则证明了它的「可扩展性」。
数据路线或将决定具身智能的扩展速度
据官方透露,目前 HiFi-UMI 数据生产体系已处理 超过 2 万小时、432 万段操作数据,覆盖 480 多个场景。
而此次深朴智能宣布开源 HiFi-UMI-2K,是从中经过质量筛选和分布平衡的 2000 小时子集, 包含六路同步视频、标定后的双手轨迹、夹爪状态、语言描述和子任务边界。

开源数据集:https://huggingface.co/datasets/simple-world-lab/HiFi-UMI-2K
对业界来说,HiFi-UMI-2K 的意义并不只在于增加了一个操作视频数据集,而是为行业提供了一批可以用于验证无本体训练、视觉动作建模、多视角表征、双手轨迹预测、跨场景迁移和动作重定向的数据。
更重要的是, 它让「高保真无本体数据能否直达真机」从一家公司的内部实验,变成一个可以被更多团队复现和检验的问题。
机器之心注意到,这项工作一经发布,迅速获得了业界的关注与热议。
截至发稿前, HiFi-UMI 已登顶 Hugging Face Daily Papers 日榜第一,开源数据 HiFi-UMI-2K 一周内下载量达 3.4 万次。

此外,AI 内容创作者 AK 在 X 上分享 HiFi-UMI 后,相关帖子浏览量也达到约 5 万次。

热度的持续扩散,无疑在说明这项工作击中了具身智能当前一个普遍存在的问题:行业一边需要更大规模的真实世界操作数据,一边又不能牺牲真机执行所需要的轨迹、时序和交互精度。
过去,这两个目标往往由不同的数据路线分别承担。HiFi-UMI 试图把规模与保真度放进同一套数据生产体系中。也是在向业界证明: 具身智能的 Scaling Law,不仅取决于模型参数和机器人数量,也取决于能否建立一条低成本、高保真、可持续扩张的数据生产链。
其实,HiFi-UMI 的起点,可以追溯到 2025 年底的一场具身智能比赛。
彼时,深朴智能团队参加了由李飞飞团队与斯坦福 AI 实验室联合发起的首届 BEHAVIOR Challenge。这项比赛的难度在具身智能领域并不多见:参赛模型需要在 BEHAVIOR-1K 环境中完成 50 项完整的家庭任务,从整理房间到清洁厨房,每一项都涉及长程移动、双臂操作和复杂环境交互,一个任务往往由数十个环节连续构成,中途任何一步失误,整段任务就会前功尽弃。主办方提供了 1 万条、超过 1200 小时的遥操作专家示范,可以说 是一个为具身智能量身定制的「超级 benchmark」。
面对这样的任务集,一种常见的做法是针对具体任务和场景做专门适配,把分数「调」上去。但这样得到的高分往往只在榜单上成立,换一个任务、换一个场景就要重来。 深朴智能选择把泛化能力放在分数之前,创新性地提出了一套 SimBot-Agent 框架, 用一套统一的机制处理任务理解、长程规划与技能执行,不为任何单项任务做特化。最终,深朴智能凭这套框架拿下全球第三名。
据团队回忆,比名次更重要的是: 当框架不再依赖针对单一任务的特化,天花板究竟落在哪里也就显露出来 —— 数据的质量和规模两个问题同时变得具体:一方面,长程任务会把示范数据的空间与时序误差逐级放大 —— 单步动作的微小偏差尚可容忍,一旦任务链条拉长,每一步的偏差都会成为下一步的起点,最终往往在中途就中断;另一方面,1 万条示范摊到 50 项完整家庭任务上,每项任务平均只有约 200 条,而遥操作的成本结构决定了它很难再往上翻几个量级。质量与规模,缺一不可,却又难以兼得。
当时看来,能同时满足两者的路径并不多。无本体采集在规模上是现成的答案,可它的保真度还远达不到长程精细操作的要求 —— 与其在遥操作一侧继续压成本,不如把无本体数据的保真度提上来。 紧接着,团队正式启动高保真 UMI 项目,一路做到今天的 HiFi-UMI。
而结合这一背景,就更容易理解 HiFi-UMI 在深朴智能整体技术路线中的位置。
深朴智能成立于 2024 年底, 围绕「模型、数据、本体、场景」构建具身智能全栈闭环。 一端是具身模型的预训练与后训练,以及面向长程任务规划、跨本体适配和非标准场景泛化的 Omni-Simple-World Model 与 Robotic Agent OS;另一端是真实机器人在酒店、康养等类家庭商业场景中的持续验证。
HiFi-UMI 对应的是这套技术体系中的数据底座。 无本体设备扩大真实世界操作的采集范围,数据引擎完成重建、校验和标注,模型通过预训练积累通用经验,再通过后训练掌握具体任务。策略最终回到真实机器人上接受检验,执行中暴露的问题又回流为下一轮采集的方向,让整条链路真正闭环。
据了解,目前深朴智能已在酒店场景开展 POC 测试,尝试让真机部署产生的新问题继续回流数据和模型系统。
最后,想要说的是, 其实限制无本体数据走向真实部署的,可能并非采集时没有机器人,而是数据中的空间、时间和交互信息还不够「HiFi」。
而随着这一缺口逐步被补齐,具身智能的数据竞争也将改写。下一阶段,比拼的也许不只是谁拥有更多机器人,更是谁能以更低成本、更高效率生产足够准确、足够多样,并能真正转化为机器人能力的操作数据。
当这条数据生产链开始规模化运转,具身智能迈向大规模真实世界部署的进程,或许才真正开始……