登录

OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验


速读:GenesisAI的首个机器人基础模型GENE-26.5也采用了egocentricdata,将真实人类活动中的视觉、动作与交互过程纳入模型训练。 其团队核心成员来自Waymo,Meta,Google,QCraft,XPENG,Bosch等自动驾驶与AI领域公司,具备从数据采集、清洗、算法、标注到模型训练的完整工程经验。 它配备了最前沿的模型算法和高度自动化的流水线,源源不断地将原始的人类视频,提纯、加工成行业亟需的robottraining-ready训练数据。 这也正是Maxinsights最有远见的一步棋:他们真正在意的,不再是每个月还能多采多少小时,而是如何把人类数据与机器数据之间的EmbodimentGap(跨本体差异),降维成一个可以通过流程和算法解决的工程问题。 机器人需要接触足够丰富的人类活动、环境、物体和任务,才能逐渐形成对物理世界的通用理解。
2026年09月17日 13:39

编辑|Sia

「 E gocentric data boom 」

9 月 3 日,OpenAI 正式发布 GPT-6 Astra。 在 ARC-AGI-3(一个考验 AI 能否在陌生环境中自主探索、理解规则并规划行动的 Benchmark),Astra 拿下 99.9% ,并在 96% 的关卡中达到或超过人类的行动效率基准。

一天后,Robocurve 将它接入真实双臂机器人,在「抓起积木并放进碗里」的任务中, 20 次成功 19 次 。

这两个结果释放出的信号是: 最前沿的大模型正在把能力边界从数字世界继续推向物理世界 。  当模型不再只是回答问题,而是需要观察环境、规划下一步并实际完成任务,它所面对的数据问题也随之发生变化。

今年八月,Dyna Robotics 第一次将人类经验( 第一人称视角数据,也叫做 egocentric data )相关的规模推到了  100 万小时 。

从 1000 小时逐档增加到 100 万小时,Dyna-2 的预测表现持续改善,没有明显吃饱的迹象。在预训练阶段没有见过的机器人任务中,Dyna-2 依然展现出更强的泛化能力。

Genesis AI 的首个机器人基础模型 GENE-26.5 也采用了 egocentric data,将真实人类活动中的视觉、动作与交互过程纳入模型训练。

这些实践共同指向一个变化:机器人训练正在开始吸收可以大规模的人类真实活动。

大模型曾经依靠互联网完成 Scaling,而机器人长期受限于真机数据——采集昂贵、积累缓慢,还往往绑定特定本体。 如今, 一条新的 Scaling 轴正在变得清晰:人类经验 。

《连线》写到,一场  「  egocentric data boom 」 正在兴起。越来越多机器人公司转向采集员佩戴摄像头产生的 egocentric video,甚至有投资人预计领先公司未来几年会购买数亿小时的 egocentric data。

问题是,谁能把这些视频里的经验,持续、高效地变成模型可用的训练数据?

在 Dyna-2 和 GENE-26.5 惊艳表现的背后,一个共同的「 卖水人」浮出水面: Maxinsights 。

它既是  Dyna-2 最大的数据合作伙伴,也是 GENE-26.5 的独家 egocentric data 合作伙伴 , Google DeepMind、Figure、1X 以及某头部大模型公司等也曾与其开展数据合作 。

这家 2024 年成立于旧金山湾区的 Physical AI 公司,已经将数据服务铺到六大洲,并于今年 3 月进入中国市场。

Maxinsights:

最早实现规模化、且累计交付量最大的

第一视角数据公司 

Maxinsights 不仅是最早的 Ego data 公司,也是最早上量的一家 。

其团队核心成员来自 Waymo, Meta, Google, QCraft, XPENG, Bosch 等自动驾驶与 AI 领域公司,具备从数据采集、清洗、算法、标注到模型训练的完整工程经验。

这套曾支撑自动驾驶发展的数据闭环能力,正在被迁移到 Physical AI 领域。

随着与硅谷 Foundation Model 和 Robotics 团队合作不断深入,Maxinsights 逐渐扩展到大规模 egocentric human experience 数据,搭建覆盖数据采集、质量控制、理解、标注到模型训练交付的完整基础设施。

这一转变背后,是机器人学习对真实世界经验的需求。机器人采集的操作数据往往与具体硬件和任务环境相关,而人类每天都在不同场景中完成大量物理交互。拿起杯子、整理物品、打开抽屉、使用工具,这些日常动作记录了物体如何响应接触、双手如何协作,以及环境状态如何随着动作发生变化。

Dyna Robotics 也在 Dyna-2 技术报告中指出:

人类执行真实任务时产生的 sensorized recording,规模几乎没有上限,同时包含了机器人 manipulation policy 所需要学习的世界动态和手物交互信息。

换句话说,如果机器人想获得类似互联网数据规模的训练资源,未必需要等机器人自己工作几亿小时。它可以先学习已经在人类世界中运行了无数年的经验库。

对于 Maxinsights 而言,将这些人类经验转化为可用于训练的数据,已经进入规模化生产阶段。

截至目前,公司建立了覆盖六大洲的采集网络,累计积累  150 万+小时带手部追踪和语言标注、可直接用于训练的高质量数据, 历史累计向客户交付超过 200 万小时。

而 它 之所以能在具身智能数据链顶端站稳脚跟 ,靠的并不只是庞大的 「 视频仓库」,更 是一座 「 智能工厂」。

它配备了最前沿的模型算法和高度自动化的流水线,源源不断地将原始的人类视频,提纯、加工成行业亟需的 robot training-ready 训练数据。

精品 1 5 0 万小时数据,远离 「 盲目上量 」

当数据规模跨过百万小时的大关,单纯靠堆人、堆规模的边际效益已经开始递减。

具身智能的数据之战,底层逻辑变了。

这也正是 Maxinsights 最有远见的一步棋:他们真正在意的,不再是每个月还能多采多少小时,而是 如何 把人类数据与机器数据之间的 Embodiment Gap(跨本体差异),降维成一个可以通过流程和算法解决的工程问题 。

根据他们的观察,未来具身智能的数据能力,会沿着两个方向同时演进。

其中一个是  Experience Scale(经验规模) 。

机器人需要接触足够丰富的人类活动、环境、物体和任务,才能逐渐形成对物理世界的通用理解。

因此,数据规模仍然重要。行业会继续从百万小时走向千万小时,甚至更大规模,让人类经验成为训练通用机器人模型的重要基础。

但规模扩大之后,另一个问题也越来越突出:模型看到了更多视频,却没有看到更多新的世界。

如果新增的数据只是重复已有场景,那么数量增长并不会带来同等程度的能力增长。

这种对有效数据的高度需求,首先会传导到采集基础设施上。Maxinsights 给出的解法,是让数据采集本身具备主动规划能力,也就是  Coverage-aware Collection 。

当数据规模进入百万小时之后,传统的被动采集方式会越来越容易暴露问题:辛辛苦苦采回来的第 1000 万小时数据,大概率成为早期数据的低质复刻。

满屏都是固定环境下的简单搬运、桌面抓取,规模上去了,系统却免疫了。

盲目上量行不通,那就主动寻找数据缺口。

依托内部的 Agent 平台,Maxinsights 可以对现有的数据池进行反向诊断,像雷达一样锁定数据分布的盲区。一旦发现稀缺环境、罕见物体或是复杂的受力动作,Agent 会立刻下发指令,定向调度全球 5000 余名采集员和专业设备进行补采。

例如,缺少厨房环境中的长尾物体,就安排对应采集;缺少柔性物体操作,就补充相关任务;缺少复杂受力状态,就针对性设计采集流程。

这套流水线还自带数据清洗功能,能自动识别并剔除无效片段、刻意摆拍和摄像头视角偏移等低质数据。

自有模型才是数据公司的技术壁垒

除了 Experience Scale,Maxinsights 观察到的第二个关键趋势是 Experience Density(经验密度) 。

一小时的人类操作视频,有的数据只能告诉模型:手移动到了某个位置。但更高价值的数据,会包含更多维度的信息。

比如,手部姿态、身体协同、物体状态变化、人与环境之间的接触关系、动作过程中的时间节奏。

这些信息越丰富,模型能够学习到的物理规律就越多。未来高价值的具身数据,并不是简单追求更多小时,而是让每一个小时承载更多关于真实世界的信息。

因此,数采之后,如何进一步理解、拆解和加工这些原始人类经验,把它们转化为机器人真正可以学习的训练信号,决定了数据价值的上限。

换句话说,真正重要的问题是: 如何充分释放每一帧画面中的信息价值 ?

Maxinsights 的解题思路是从关注 Task Coverage(任务覆盖),转向更细粒度 State Coverage(状态覆盖)。

下面这段演示中,视频不再被压缩成一句 Caption,而是变成一个由场景理解、任务边界、三维空间关系、双手微操轨迹、动作时间序列紧密咬合的高维数据结构。

它尽可能保留了人类操作过程的空间、动作与时序信息,让视频变成 Dyna-2 这类模型可以直接用于学习物理交互规律的训练数据。

支撑这套数据加工管线的,是 Maxinsights 自研的核心 AI 引擎。

作为专门针对具身场景强化过的视频理解大模型, MaxVLM 负责从视频中提取高阶语义 。

主题:模型|Dyna-2|大模型|GENE-26.5