具身智能数据“狂飙”,但还未完全实现模型验证
近日,多家具身智能企业发布了数据采集的阶段性成果。
如智元机器人旗下觅蜂科技宣布累计生产超过100万小时高质量无本体数据。北京人形机器人创新中心(以下简称“北京人形”)发布并开源RoboMIND具身智能数据集,全球下载量超过2000万次,目前年产能可达18万小时等等。今年以来,还有多家企业都开发推出了数采相关设备和方案。
具身智能大模型的“进化”离不开训练数据,而人类与物理世界的交互数据一直存在较大缺口。相比于往年,行业数据规模实现了明显增长。但数据量的增长能否转化为有效的模型验证,仍有待真实场景应用的检验。
数采工厂先跑通闭环链路
北京人形的机器人训练数据主要来自于其旗下的数采基地。近日,第一财经记者在实地探访时看到,该基地内部搭建复刻了家居、商超、工业、医药等领域典型场景,同时还建有专业光学动作捕捉场地。
北京人形数据基地
数据采集员们通过专业设备遥操真机或者佩戴头环等完成任务,他们基本都是在固定区域内工作,时长在8个小时左右。例如,在厨房场景下,数采员遥操控制机器人用夹爪抓起抹布、擦拭灶台等,这一系列动作可能就几十秒时长,但他要重复数次。
“数采员要摆道具、收拾场景,一天采集数据总时长差不多在6个小时,经过三道质检程序后有效数据时长差不多在三四个小时。”北京人形数采基地负责人夏华林表示,这也是基地采集数据质量较高的一大原因。他举例称,今年上半年基地给一家头部客户交付项目,验证通过率能够达到95%以上。
据介绍,该数采基地既服务于天工机器人的训练,同时也会服务于其他外部客户,目前已对外交付近3万小时高质量数据。该基地拥有超过150台主流机器人设备,100余台无本体采集设备。这种“真机+无本体”“跨场景”“多任务”同步开展的模式也被称为是矩阵式的采集。
北京人形数采基地还打通从数据采集、清洗、质检、标注、模型训练、真机评测、模型部署、数据回流完整闭环链路,其中多个环节借助了AI工具。比如,质检环节可以通过平台实现24小时自动化处理,仅需要员工进行少量抽检,数据生产、交付效率有了提升。
夏华林讲述称,“白天采集完的数据,上传后晚上会在云上自动化处理,第二天就可以交付给客户。”他还表示,数据基地的愿景是打造百万小时的高质量数据集。
记者注意到,除了北京人形数据基地之外,星海图、光轮智能、京东等都在冲刺类似的目标,近期觅蜂科技还宣布已累计生产超过100万小时高质量无本体数据。
夏华林提到,目前还不清楚用如此大量的数据进行训练是否能得到一个很好的模型验证,效果究竟如何还要在真实落地场景中进行判断。现阶段,集中式的采集可以快速提升数据规模,至少能先帮助验证整个闭环。
真实场景是最终考场
为了提升模型的泛化能力,多家企业在训练时也会采用多类型的数据,不局限于数采工厂。
多家受访机器人企业表示,从他们接触的情况来看,目前行业供应的数据质量存在参差不齐的问题。无界动力创始人兼CEO张玉峰介绍,公司大模型的预训练以无本体、互联网视频以及真机遥操等数据为基础。他以无本体数据举例称,不同厂商推算标注的手部关节数据的精准性、信息密度等情况不一,这些都会影响到训练的效果。
受访对象表示,这背后与数采标准不一、人员专业素质等有关。星动纪元联合创始人席悦也观察到类似的情况。他介绍,为了保证质量,公司会先给到供应商数据采集的标准和格式。
张玉峰还补充称,公司的真机数据一部分来自于数采工厂,但数量不多。“相比于真实场景,数采工厂的真机数据有一定局限性。这是因为数采员缺乏像工厂、商业场景下的产能驱动,完成动作的速度比较缓慢。”他还提到,数采工厂复刻的场景也缺少真实环境中的随机性。
在张玉峰看来,数据采集、训练以及验证还是必须延伸至真实场景。比如机器人进入咖啡店上岗,只有在真实场景下部署机器人,团队才会发现泛化性、安全性的问题。
“虽然目前高质量数据没有定论,但我认为最有价值的数据是让模型在每个场景里面能够落地并产生很好效果。”夏华林表示。
真实作业环境下的数据,被不少行业人士认为是高质量数据,而这类数据的获取并不容易。
席悦在接受采访时提到,目前一些公司有进行POC验证的想法,但如果只是通过一两台机器人采集又很难达到Scaling Law。他表示,要实现多台真机进入作业环境中采集数据,首要前提还是要保障机器人具备一定的能力,客户才可能真正愿意合作。
“一开始可能就要让机器人的能力达到70分,部署进入到真实环境中再提升至90分甚至是100分。”席悦介绍,他们公司的机器人已经进入到多个快递物流场景上岗。其中,和一家客户的合作,从POC验证到慢慢上量,这中间的周期长达几个月。“打工”第一天,机器人的准确率还不高,但后面一段时间有了明显提升。
他认为,真实场景下积累的数据能够带来一个正向的数据飞轮循环,之后机器人在类似快递工厂场景的部署时间或能以周计算。