未来智造局|具身智能数据加速“上量”,如何定义“好数据”?
未来智造局|具身智能数据加速“上量”,如何定义“好数据”?
2026年09月25日 13:01
新华财经上海9月25日电(记者杜康)前不久,觅蜂科技宣布累计生产无本体数据已超过100万小时。另一家企业穹彻智能也表示,约半年时间内,公司自采通用操作接口(UMI)数据超过10万小时,自采第一视角(Ego)数据达到万小时级。
从依赖 机器人 真机遥操作,到通用操作接口、第一视角、数据手套等无本体采集方式加速兴起,具身智能数据正在进入规模化“上量”阶段。然而,数据时长增长并不意味着模型所需的高质量数据生产模式已经成熟。不同数据如何适配不同模型和 机器人 本体,高质量数据标准是否清晰,训练场如何避免陷入重场地,均有待产业进一步探索。
无本体数据进入规模化上量期
在 人工智能 的发展逻辑中,数据、算力和算法是三大关键要素。然而,与拥有海量互联网语料的语言模型相比,具身智能训练数据必须在物理世界中产生,不仅需要记录 机器人 “看到了什么”,还要同步记录执行了什么动作,以及动作如何改变周围环境。
数据采集需要与 机器人 本体、操作人员和物理场景紧密绑定,由此形成了物理AI的“数据荒”。
过去,真机遥操作是行业获取 机器人 数据的主要方式之一。工作人员需要在固定数采工位操作 机器人 完成预设任务,不仅受制于机器人本体数量,采集效率和成本也成为规模扩张的限制。
京东 科技集团副总裁何贺回忆:“一年前,员工带着机器人本体干8个小时,往往只能产出1小时的有效数据。算上高昂的电费、场地和人工成本,产能极低且昂贵。”
为突破真机数量和采集成本的限制,行业转而寻求替代性的数据解决方案,无本体数采方案便是其一。“无本体采集”这种方式不依赖完整的机器人本体,而是可以通过头戴设备、腕部相机、手持夹爪等轻量化设备,直接记录人在真实场景中的操作过程。
“目前来看,无本体数据大致可以分为三类,一类是UMI数据,通常由人手持接近机器人末端形态的夹爪进行操作,在采集阶段就将人的动作与机器人动作进行一定程度的对齐。一类是第一视角采集数据,通过头戴设备、眼镜或相机记录人在真实环境中的裸手操作。还有一类数据,是通过数据手套进一步加入触觉、惯性测量单元等 传感器 ,以捕捉视觉之外的精细动作信息。”高工机器人产业研究所(GGII)所长蔡炳贞表示。
相较于真机遥操作,无本体采集不必为每个采集工位配置完整机器人,部分方案还可以嵌入工厂、家庭等真实活动,在不脱离原有作业的情况下伴随式产生数据。这使得数据采集的成本下降,场景覆盖范围也得以扩大。
由于采集方式的便捷,无本体数据开始快速上量,数据价格也在下降。蔡炳贞表示,目前真机遥操作数据的报价价格约为每小时500-1000元,UMI数据为每小时数百元,第一视角数据已降至每小时不足100元。
没有“一统天下”的路线
无本体采集快速升温,并不意味着行业已经找到一条可以解决所有问题的技术路线。
蔡炳贞表示,看起来是采集设备和数据形式不断变化,实质上是模型需求在推动数据供给方式变化。不同路线并非简单的前后替代关系,而是在采集成本、生产效率、场景覆盖、动作对齐和信息完整度之间作出不同取舍。
UMI的优势是,在采集端便将人的操作方式与机器人夹爪部分对齐。对于现阶段较多采用二指夹爪、任务相对明确的机器人,UMI数据具有较高的直接利用率。但这种对齐也带来限制。操作者手持夹爪后,动作效率通常低于裸手操作,难以直接嵌入部分对生产节拍要求较高的工厂。同时,不同夹爪、机械臂和机器人本体之间仍可能存在映射与适配问题。
第一视角数据相反。它对人的正常操作干扰较小,更容易覆盖大量真实场景,成本和规模化效率也更具优势。但仅依靠图像判断手部位置和动作轨迹,精度仍然有限。
穹彻智能现阶段选择以UMI数据为主,正是由其近期的机器人落地形态反向决定。公司AI科学家吕峻表示,公司判断具身智能有望率先在二指夹爪上实现作业落地。相比五指灵巧手,二指夹爪硬件成本较低、任务空间相对简单,对触觉和模型能力的要求也相对有限。更符合现阶段具身智能的技术成熟度和商业落地条件。
“在这一目标下,UMI数据与机器人的动作形态更为匹配,人的行为与机器人行为之间的对齐难度因此明显降低,数据利用率也相对更高。同时,他提到,目前公司也在购买一些Ego数据,”随着模型处理人机动作映射的能力增强,第一视角数据的占比可能逐步提高。吕峻表示。
数据手套则体现了另一重取舍。蔡炳贞表示,对于精细操作而言,仅有视觉信息并不充分,数据手套可以补充触觉、力度和高频动作等多维信息,可能成为灵巧操作数据的重要来源。不过,吕峻也提醒,现有数据手套由于搭载 传感器 ,往往较为厚重,可能干扰人的正常操作;与此同时,触觉技术和五指灵巧手本身仍不成熟。
在行业人士看来,随着更多数据采集方式的出现,无本体数据、真机遥操作和仿真数据等数据类型更可能是重新分工,而非一种方式完全取代其他。比如,未来大规模预训练可能更多依靠覆盖广、成本较低的真实无本体数据;进入具体任务、具体工厂和后训练阶段后,仍需补充少量真机遥操作数据进行校准。
供给模式加速探索,数据产业化仍待形成闭环
无本体数据进入上量阶段后,数据交易也随之升温。
需求端,不少机器人企业通过“自己采+外部买”方式训练具身“大脑”。一些大模型公司也在购买“无本体”数据。腾讯Robotics X实验室Tairos产品生态负责人朱亚娟表示,无本体异构数据有助于模型更好地理解物理世界,结合夹爪采集数据,可以在一定程度上减少对特定本体遥操作数据的依赖。
供应端,以无本体采集为例,行业人士判断,由于采集门槛较低,行业会逐步进入“众包时代”。除了数据公司,吕峻介绍,一些人力外包服务商甚至也开始参与数据生产。这类企业未必具备模型研发或数据处理能力,但擅长招募和管理数据采集人员。
然而,数据供给规模的快速扩大,并不等同于产业模式的成熟。伴随数据量由少到多,一系列问题开始浮出水面。
比如,数据的标准依然缺失。蔡炳贞表示,模型企业对无本体数据的接受度已经较高,行业所说的“标准缺失”,并不只是文件格式或交付流程尚未统一。摄像头数量、数据格式、时间戳等技术指标相对容易规范,真正困难的是确定一套能够适用于不同模型和机器人本体的有效标准。
比如,门槛降低引发的数据质量风险。吕峻表示,数据容易复制,难以自证和溯源。在随着供应商数量增多,已经可以看到重复转售等现象。在这种情况下,数据质量难以保证。
又比如,近来受到较多讨论的“具身智能训练场”模式,也面临着相似的审视。业内的关注点已不仅是建了多少平米场地、采购了多少台设备、记录了多少小时,而是这些场地能否真正接入多样、复杂的非结构化任务。如果只是在受控空间内重复简单动作,数据的边际效益会快速递减。
因此,规模只是具身智能数据产业化的起点。多位从业者认为,随着粗放“上量”阶段过去,数据供应商未来的竞争也在发生变化。单纯比拼设备数量和时长账面数字的模式很难持续,真正的考验在于能否深入真实的工厂和生活场景,能否对采集人员和操作规范进行有效管控。数据需要与具体任务相适配,并根据模型训练和真机执行结果持续迭代,才能让机器人学会“真干活”。
(文章来源:新华财经)