登录

让普通人给机器人喂数据:质量参差、隐私担忧、重资产投入,众包数采是门好生意吗?


速读:百万小时对今天而言已无法满足需求,不少模型和具身智能公司已达百万小时级数据需求,因此必须开启新的增长曲线。 据介绍,数据采集不再是某家企业的工作任务,而是开放给了普通人。 但众包采集者都是普通人,让普通人给机器人当老师,质量参差不齐,隐私边界模糊,又是重资产投入,这到底是不是一门好生意? 操作很简单:用户把手机一架,录一段自己擦桌子、叠衣服、切菜的第一视角视频并上传,企业就按数据采集的质量和时长付费。 但这能否覆盖众包场景的复杂性,仍有待考验。
2026年09月25日 12:

9月23日,觅蜂科技在上海发布首个物理AI数据众包服务平台“觅蜂派”。

据介绍,数据采集不再是某家企业的工作任务,而是开放给了普通人。用户下载该应用后可以领取数据采集任务,并佩戴MEgo设备在零售、仓储、制造、家庭等真实场景中完成指定操作,按照审核后的有效数据时长获得报酬。这意味着,物理AI数生据产模式走进“全民数采”时代。数据经治理、分级后,用于具身模型训练,并服务于机器人真实部署。

但众包采集者都是普通人,让普通人给机器人当老师,质量参差不齐,隐私边界模糊,又是重资产投入,这到底是不是一门好生意?

▲发布会现场糕点师在指导体验者 ▲发布会现场糕点师在指导体验者 众包便宜、广覆盖

但质量与隐私问题待解

数据采集的众包模式,此前美国企业Figure已有尝试。今年8月,Figure发布Index项目,通过向用户付费采集真实任务视频,构建多样化训练数据集。操作很简单:用户把手机一架,录一段自己擦桌子、叠衣服、切菜的第一视角视频并上传,企业就按数据采集的质量和时长付费。

Figure公布的Helix2.5实验显示,在30套陌生住宅中,不采数据、不额外训练,Index预训练让零样本成功率从9%提升至56%。这为众包数据提供了想象空间。

这样的数采优势显而易见。它把数据采集从集中式、雇佣式,变成分布式、社会化协作。用户不必专门花时间,而是在正常生活或工作中顺便采集,获得额外补贴。

据觅蜂派官方透露,其覆盖22大类场景、5000多个任务、50000多个真实环境,内测一个月注册用户2万人,累计1.3万份采集任务提交。

但疑问也明显,采集者都是普通人,质量参差不齐,数据的有效率如何保证?“集采的数据不会百分之百流到模型训练,但也不会损耗太大。”觅蜂科技董事长兼CEO姚卯青称,结算环节会用自动化方法提取有效时长,切掉手不在画面、休息、动作不规范、主观重复等无效部分;结算后超过95%的数据最终能被利用。

“数据质量分很多层,不是非黑即白。”姚卯青解释,不同模型有不同的训练阶段,可以利用不同质量等级的数据,采集到的数据一般会被贴上质量标签,尽可能地保留下来。

另一方面,隐私问题也是外界所关注的。觅蜂派称建立了敏感内容识别、人脸及个人信息脱敏、实名认证、电子签约、授权留存和分类分级管理机制,并联合发出《具身智能数据安全行动倡议》。但这能否覆盖众包场景的复杂性,仍有待考验。

为何是众包:

千万小时数据需求与 细分 场景缺口

过去三年,具身智能从“开发态”走向“部署态”,业界普遍认为,要实现具身AGI,数据至少要从百万小时扩展到亿级小时。

但具身模型没有大语言模型那样的海量文字语料,抓起杯子、拧开瓶盖、折好衣服,这些日常动作至今没有形成可直接训练的大规模数据。

此前行业的通行解法是真机遥操:人通过手柄、VR设备操纵机器人,把任务示范给模型。这样的采集速度受机器人数量、操作人员和场地约束,硬件、人力与运营成本随数据规模同步增加。

姚卯青在采访中直言,百万小时对今天而言已无法满足需求,不少模型和具身智能公司已达百万小时级数据需求,因此必须开启新的增长曲线。目前行业迫切需要数据的场景丰富度。“质量是基础,但在百万小时积累过程中已经打磨相对成熟了,接下来场景丰富度肯定是最关键的。”

他认为,现在行业需要的不是简单堆量的数据,而是往细分赛道和专业技能走。“叠衣服数据已经泛滥了,大家可能需要更专业的,哪怕你是去修水管、修车。”

姚卯青认为,众包方式更加灵活,可以更便利地进入到这些场景里,相较于专职雇人更有场景和成本优势。照他所述,当数据量越大,模型效果越好,后续人工的占比会更低,同时自动化程度更高。

但众包平台不是轻生意。姚卯青称,采集设备生产、人员结算、云端存储计算都是重投入,应对1000万小时数据需要数亿元固定资产级别的投入。这也意味着短期可以用补贴换规模,但长期的用户活跃度与留存率仍有待观察。

主题:数据|众包|质量|数据采集|质量参差