登录

宝妈、店员替机器人采数据!觅蜂科技高管:注册需个人信息授权,隐私会脱敏处理


速读:9月23日,觅蜂科技在多地大数据局指导下,与中国信息通信研究院共同发布《具身智能众包数据发展报告》框架。 领取设备后,数据采集过程中还会进行脱敏处理。 觅蜂科技数据脱敏主要通过自动化完成。 觅蜂科技高管:注册需个人信息授权,隐私会脱敏处理2026年09月24日19:52时代财经用付费众包的方式采集真实任务数据。 9月23日,觅蜂科技上线“觅蜂派”,把具身智能的数据采集做成了一门可以接单的生意。
2026年09月24日 19:5

用付费众包的方式采集真实任务数据。

机器人还没走进千家万户,教机器人干活的人,可能已经先进入千家万户。

9月23日,觅蜂科技上线“觅蜂派”,把具身智能的数据采集做成了一门可以接单的生意。宝妈、店员、手艺人等普通人,可以领取任务,佩戴MEgo设备,在家庭、零售、仓储、制造等真实场景完成指定动作,再按照有效采集时长获得报酬。

如果说外卖平台把分散的骑手组织起来,解决的是“最后一公里”的运力问题,那么觅蜂想做的,是把分散在真实世界里的普通人组织起来,成为机器人的“数据骑手”。

这背后的逻辑很简单:机器人还不够多,但人一直在做事。过去,机器人训练数据主要依靠机器人本体采集。可在人形机器人尚未大规模部署的阶段,仅靠机器人自己“打工”或者数采工厂产生数据,很难快速积累足够规模的真实物理数据。

于是,越来越多公司开始尝试让人来采。8月,Figure推出Index,也在用付费众包的方式采集真实任务数据。觅蜂则把这套模式进一步推向家庭、门店和工厂,试图把普通人的日常劳动变成机器人训练数据。

问题也随之而来。时代周报记者此前实测MEgo,在家中佩戴设备完成任务时,一个直观感受是:设备记录的不只是手正在做什么,家庭空间、物品,甚至其他人的活动,也可能进入镜头。

对此,觅蜂科技觅蜂派业务总经理张智富向时代周报记者表示,隐私保护首先从用户授权开始。众包人员注册App时,需要签署相关个人信息授权协议;领取设备后,数据采集过程中还会进行脱敏处理。

“设备采集过程中,会在App端上进行脱敏。”张智富表示,数据上传云端后,平台还会围绕信息安全建立多重防护机制,并与相关主管部门推进数据安全方面的工作。

9月23日,觅蜂科技在多地大数据局指导下,与中国信息通信研究院共同发布《具身智能众包数据发展报告》框架。在张智富看来,关键是建立一套完整的数据安全体系,让参与众包采集的用户能够“放心采集、安心采集”。

无本体数采:把人变成数据入口

大语言模型的一个重要优势,是互联网上已经存在海量文字和图像数据。具身模型没有这样的先天条件。抓起杯子、拧开瓶盖、叠好衣服,这些人类每天重复无数次的动作,对机器人来说仍是稀缺数据。

模型要学会在真实世界里做事,首先要解决的不是模型有多大,而是从哪里获得足够多的“做事”数据。业内一种常见判断是,如果具身智能最终要走向更高阶的通用能力,训练数据规模可能需要从今天的百万小时级,进一步扩大到亿小时级。

过去,行业最常用的数据采集方法是真机遥操。人通过手柄、VR设备等控制系统操纵机器人,把一个个任务示范给模型。这种形式优势很明确:数据直接来自机器人本体,与关节、坐标系、控制频率等参数高度匹配,因此训练价值较高。

但问题也同样明显。真机遥操数据很大程度上被机器人本身“锁住”。不同厂商的机器人在关节数量、坐标系、控制频率等方面存在差异,一套本体采集的数据,很难直接迁移到另一套本体;换了机器人,往往意味着重新采集、标注和训练。

与此同时,不同数采工厂之间的数据仍然相对割裂,高价值数据又往往受到商业利益和合规要求限制,进一步降低了数据流通效率。

今年以来,行业开始寻找另一条路径:让人直接成为数据入口。人不需要操纵一台真实机器人,只需要在真实环境中完成一个任务,设备在这个过程中记录人的动作、视角以及与环境的交互,再将这些数据转化为机器人训练所需的数据。

这也是“无本体数采”最核心的变化:机器人训练数据不一定非要由机器人产生,人类“做事”本身,也可以成为数据来源。

事实上,这和自动驾驶的数据逻辑有些相似。汽车企业通过真实车辆的大规模行驶,把驾驶过程持续转化为数据,数据再反哺模型和系统,最终形成数据飞轮。对于具身智能而言,机器人数量远没有汽车那么庞大,真正数量庞大的反而是人,以及人每天发生的大量物理交互。

“以销定产”

当人成为数据采集节点,规模问题解决之后,新的问题也随之出现。首先是隐私。人在真实环境中完成任务,记录下来的并不只有手部动作。家庭空间、商品信息以及其他人的活动,都可能进入镜头。数据进入训练流程前,还需要经过治理和分级。

觅蜂科技董事长兼CEO姚卯青告诉时代周报记者,数据脱敏主要通过自动化完成,而不是由员工逐帧查看、手动给人脸打码。“后台员工不会看到这些信息。”他说。

另一个问题是,众包会不会带来大量重复的数据。如果不同采集者都在做相似的家务、整理商品或简单操作,数据规模虽然迅速扩大,但有效信息未必同比增加。真正稀缺的,反而是那些低频、复杂、难以进入的任务。

对此,觅蜂采用的是任务认领机制。姚卯青介绍,任务会提前发布在任务大厅,达到所需采集量后,任务便不会继续开放,避免同一类数据被无限重复采集。对于更难获取的场景,则通过提高任务补贴吸引采集者进入。

这或许意味着,做众包数采,不是参与的人越多越好。真正重要的是,客户需要什么数据,就去采什么数据;已经采够的数据,就不再重复采。

姚卯青将这种模式概括为“以销定产”。觅蜂会先从市场端获取客户的订单需求,再对需求进行归纳、去重,与现有数据库存进行匹配。已有库存能够覆盖的需求,不再重复生产;无法满足的,再根据订单的当前及长期价值,以及平台现有的人员、场景等资源,对任务进行优先级排序,再分发到不同的采集路径。

从这个角度看,众包数采真正要解决的,并不是把更多人变成数据生产者,而是让有限的采集能力,尽可能流向真正缺数据的地方。

主题:数据|机器人|觅蜂科技