登录

RoboPapers专访光轮智能谢晨:具身Scaling Law的两座金字塔


速读:后者是MolmoAct系列机器人模型的作者,研究方向正是机器人基础模型与可扩展数据采集。 机器人数据的出路,是Robot-AgnosticData(本体无关数据)。 DYNA-2,一个完全用人类第一视角视频做预训练的机器人基础模型,预训练数据量超过100万小时。 因此,机器人需要两座金字塔:训练金字塔的核心是可规模化的人类数据,评测金字塔的核心是可规模化的仿真。 最近几个月,节目先后围绕1XWorldModel、NVIDIADreamZero、TedXiao所总结的机器人学习三个阶段,以及Dyna-2的百万小时实验展开对谈,这也对应着具身行业的最前沿方向的几个成果:世界模型、人类数据、规模化。
2026年09月09日 22:46

编辑|Panda

近日,机器人圈知名播客节目 RoboPapers 更新了一期专访,对象是 光轮智能创始人兼 CEO 谢晨博士 。这期节目的采访人是 RoboPapers 播客联合主持人 Michael Cho 和新加坡国立大学(NUS)助理教授 Jiafei Duan。后者是 MolmoAct 系列机器人模型的作者,研究方向正是机器人基础模型与可扩展数据采集。

这个由机器人研究者主持、邀请论文作者亲自讲解工作的深度技术访谈节目已然成为全球具身行业的风向标。节目邀请嘉宾大多为斯坦福、伯克利、英伟达、Dyna 等前沿实验室的研究人员。最近几个月,节目先后围绕 1X World Model、NVIDIA DreamZero、Ted Xiao 所总结的机器人学习三个阶段,以及 Dyna-2 的百万小时实验展开对谈,这也对应着具身行业的最前沿方向的几个成果:世界模型、人类数据、规模化。

这次的深度访谈主要围绕三个议题 :一家仿真的头部公司,如何成为全球首个具身数据独角兽公司?光轮智能如何打造数据管线,规模化生成高质量数据?开源 10 万小时高质量数据,光轮智能怎么实现商业价值、保持行业头部的位置?

这次访谈谢晨也给出了一个新的判断: 具身智能的 Scaling Law 需要 训练和评测 两座金字塔,训练金字塔的底座是人类数据,评测金字塔的底座是仿真。

一、机器人开始从人类经验中寻找 Scaling Law

8 月 10 日,位于加州红木城的 Dyna Robotics 发布了  D YN A-2 ,一个完全用人类第一视角视频做预训练的机器人基础模型,预训练数据量超过 100 万小时。

Dyna 把预训练数据量按 1000 小时、1 万小时、10 万小时、100 万小时搭成阶梯,在 14 个任务上用同一套后训练配方逐级测量。其归一化得分从 20% 上升到 53%;其中一个开锁任务在 10 万小时以下的成功率始终为 0,到 100 万小时上升到 90%。

但在谢晨看来,机器人 Scaling Law 并不只发生在训练数据一侧。当训练数据开始规模化,评测能力也必须同步规模化。因此,机器人需要两座金字塔: 训练金字塔 的核心是可规模化的人类数据, 评测金字塔 的核心是可规模化的仿真。前者解决机器人「从哪里学」,后者解决「如何知道它学会了什么、还缺什么」。

也正是在这个背景下,RoboPapers 把目光落在了光轮智能—— 人类数据交付达到全球第一,且刚刚开源了全球最大规模的高质量多模态人类视频数据 EgoSuite-Open100K 。

在 2026 世界机器人大会上,光轮智能开源了  EgoSuite-Open100K 。 这是一个 规模达 10 万小时的全模态人类行为数据集 ,覆盖 15,000 多个场景,包含 15,000+ 项任务,头部与腕部双视角,带手部与全身位姿、语义标注和深度信息。首批数据在 Hugging Face 与 AtomGit 开放,项目同步捐赠给开放原子开源基金会孵化。此次开源,还得到 Hugging Face 的首席科学官 Thomas Wolf 的罕见站台。

可以说,Dyna-2 给出了模型侧的证据,光轮智能则正在从数据供给侧去为行业解决这个难题。

二、训练金字塔:人类数据如何支撑规模化学习?

Jiafei Duan 直言:「 很多时候,看到高质量的机器人仿真演示,我会立刻想到这很可能来自光轮智能。 」他的提出的第一个问题就是,一家在仿真取得巨大成功的公司,为什么还要做人类第一视角数据?

谢晨从供给侧给出了回答:自动驾驶有数以百万计的量产车在路上运行,司机的每一次操作都可能成为监督信号;机器人尚没有这样的基础设施。「全球人形机器人可能只有几万台,而且它们并不会一直采集数据。 机器人数据的出路,是 Robot-Agnostic Data(本体无关数据) 。 」

真机数据 依然重要,但无法满足规模化的需求:它质量高、物理真实,也负责把模型先验落到具体机器人的观察空间、动作空间和动力学约束上;但它通常绑定特定本体,采集成本高,本体与任务变化后,历史数据也很难直接复用。

因此,数据金字塔的底部,是 第一视角人类数据 ,用来解决规模化的问题:为模型提供跨任务、跨环境和跨本体的预训练经验。 少量高质量机器人数据 解决的是 Embodiment Grounding:把这些经验对齐具体本体。 仿真 解决的则是 Rollout 与 Verification:扩展长尾状态、支持强化学习,并以更低成本持续评测模型。

Robot-agnostic 并不意味着 robot-free。人类数据、机器人数据和仿真不是三条相互替代的路线,而是一个训练与验证闭环里的不同层次。

相较于绑定某一种机器人本体,人类数据具有更强的跨本体复用潜力,但仍需经过动作表示对齐和真机落地。谢晨有一个清晰的判断:「 人类数据可能是机器人基础模型最具规模化能力的来源。 」

三、真正的壁垒是如何生产高质量的数据

谢晨在访谈中透露,开放这批数据的底气,来自光轮智能强大的数据引擎——把采集、自动标注和质检都做成可规模化的 pipeline,从而实现高质量数据的规模化生产。

高质量数据可以总结成四个关键维度。

第一个关键维度是 视频质量 ,它是整条产线的门槛:有没有坏帧,双手是否始终在画面内,动作是不是自然。例如,采集者的动作需要保证是一个自然的任务状态,不能太快也不能太慢。光轮智能在采集端就采用了一套实时的 agentic 质检流程,一个片段采完立刻被自动质检,反馈直接回到采集者手上。谢晨认为这一步的价值还没有被行业认识到:「 让数据采集者在工作中学习、实时获得反馈并不断改进 ,本身就是数据质量体系非常重要的一部分。」

自动质检之后还有两轮人工复核。为什么已经用了 AI 还要留人?谢晨回答,「Agentic workflow 的 precision 和 recall 已经很高,但还没有到 100%,因此最终质量分数必须结合自动质检和人工质检。」更关键的是,人工复核捕捉到的失败样本还会反过来喂给自动化流程:「 我们正在建立一个持续反馈闭环,用人类反馈不断改进自动化流程。 」

第二个关键维度是 手部位姿 ,是决定数据质量的关键,手部标注的精度直接决定数据价值。光轮智能为此设有专门负责手部自动标注的团队,自研了一套完整的算法进行位姿的计算。

第三个关键维度 语义标注 则是当下真正的瓶颈。内部已经迭代了七个版本,从事件级做到动作级。难点不在于描述本身,而在于时间戳——动作从哪一帧开始、哪一帧结束,VLM 目前给不了足够准的答案。眼下的解法是组合拳:用已经积累的动作级标注数据去微调基础模型,让 VLM 更准,从而把人在回路的比例一点点压下去。

排在第四位的 全身位姿 被他归为相对早期的部分,因为头部实验室的机器人基础模型目前基本都从手开始。

除此之外,对客户来说还有一个更关键的维度: 多 样 性 。「真正难的是,在保证高质量数据生产的同时,做到任务多样性、场景多样性和采集者多样性」。为此,光轮智能将任务场景归成家居、酒店、零售、运动、物流、办公、工业七大类,每类之下再拆具体任务。为了管理这个组合空间,内部专门做了一个任务 agent,负责生成任务、维护任务、把任务与真实场景和真实采集者匹配起来。每个场景和任务,都会限制采集时长,用于保证数据多样性。

四、评测金字塔:数据规模越大,越需要规模化仿真评测

经典仿真的一个核心难题,是即使拥有足够完善的仿真引擎,也很难回答「究竟应该模拟什么」。

光轮智能从真实世界的第一视角数据中提取任务与场景分布,再将其转化为仿真测试环境。这使仿真从近乎无限的探索空间中获得了明确起点,也让规模化场景测试更具可行性。

这个判断与实践得到了两位主持人的高度认可。

谢晨此前先后在 Cruise 与英伟达从事自动驾驶仿真工作,并从长期仿真实践中总结出了一个深刻判断:要让仿真规模化,必须先有规模化的真实数据来对齐、标定和验证。在这个过程中,光轮智能也一直和外部具身的研究团队保持交流,最后探索的最大发现是, 把第一视角数据和仿真数据有效协同,是规模化训练机器人的绝佳路径 。

在这个过程中,谢晨重新定义了「 数据金字塔 」。目前具身行业通常描述的数据金字塔主要是描述模型训练的数据分布:顶部是遥操作数据,中间是仿真数据,底部是人类数据与互联网数据。

谢晨则认为:「我觉得其实有两座数据: 一座用于训练,一座用于评测 。」

在 训练侧 ,第一视角人类数据和仿真合成数据主要提供规模化的预训练和中期训练经验,真机数据负责最终本体落地。

在 评测侧 ,仿真提供规模化评测的环境,而且是可复现、可比较、可诊断的,适合初始能力评测;往上是真机评测和真实环境评测,用于最终能力部署的评价。

在光轮智能的产品体系里, Ro boF inals  承担着仿真评测的任务,谢晨把它比作「机器人的高考」。但「高考」只是第一层比喻,更关键的是评测不能是一套永远不变的题库。

目前行业里,大量仿真 benchmark 的任务和场景来自人工构造。光轮智能的思路,是从真实数据中抽取代表性任务与场景,进入仿真平台  SimFoundry  完成任务和场景的生成,再由  RoboFinals  观察数据变化是否真正转化为机器人能力变化。

基于光轮智能全栈自研的 SimFoundry,这套评测体系得以确保物理真实 :光轮智能打造的物理测量工厂,可以用机械臂、灵巧手和触觉传感器测量开门、可动部件与线缆形变等真实力学信息;这样打造出一个物理真实的环境,并同步构建出真实的任务,让模型进入其中进行规模化的评测;为了减小仿真与真实之间的 Gap,还需要通过抽样真机验证,逐步检查仿真结果与真实机器人表现的相关性。

每一次真实失败,都可以变成一道新的考题;每一道新考题,又重新定义下一批数据。因此评测在光轮智能的持续学习系统里成为了一个正向的反馈,帮助模型进行高效的迭代。

五、 「三个唯一」:两大国际具身标准与全球五大具身基础设施里的唯一中国公司

光轮智能这套数据认知与工程方法,已经得到了市场认可。

「 没有标准不能做标品,没有标品没法实现规模化。 」据披露,光轮智能标品数据的复售倍数已超过 10 倍,高质量数据被世界头部模型团队验证,模型客户复购率接近 100%,头部客户数据采购规模扩张了 20 倍;近三个月已服务 30 多家头部模型企业,每家交付超 20 万小时标品数据。

这些标品数据直接检验了「robot-agnostic」这个技术假设:同一批数据能卖给不同本体、不同模型团队反复使用,说明它确实没有绑定在某一种硬件形态上。反过来,如果每个客户都要定制,这条路就不成立。「如果只顺着客户需求做,你会变成一家高度定制化的公司:质量可能很高,但不具备规模化能力,也不代表真实世界的分布。」

谢晨在 RoboPapers 专访中披露,已有数家客户分别预订了明年超过 500 万小时的产能。预订显示了市场对规模化供给的需求,但真正的壁垒仍然取决于这些需求能否被持续转化为高质量、可复用、具有合理单位经济性的标准产品。他给团队定的目标里,「单位经济性」和「规模」是并列的:「 真正的目标,是在扩大规模的同时,持续保持并提升数据质量和单位经济性。 」

标品之中更蕴含着标准。 光轮智能是两个国际物理 AI 标准组织的唯一中国企业 :

在仿真领域,作为  Newton 仿真技术委员会唯一中国企业 ,光轮智能与英伟达、谷歌 DeepMind、 迪士尼研究院、丰田研究院四家顶尖机构共同引领下一代开源物理 AI 仿真标准,参与下一代物理 AI 仿真基础设施的规则共建。

在数据领域,作为  EgoVerse人类数据委员会唯一中国企业成员 , 光轮智能与Stanford、Meta、Scale AI、Mecka AI 等国际团队共同构建全球最大规模的人类数据训练体系,代表中国企业在具身数据侧的国际标准共建话语权。

主题:数据|机器人|光轮智能|人类数据|规模化|训练金字塔|两座金字塔