登录

李飞飞买下昔日博后创业公司背后:要给机器人造一个无限试错的世界


速读:7月21日,李飞飞创办的空间智能公司WorldLabs宣布收购机器人仿真初创公司SceniX,后者致力于把真实场景转化为可供机器人训练和评估的数字环境。 当主持人问及WorldLabs是否会推出面向机器人的基础模型时,李飞飞没有否认这种可能。 从具体用途看,这套数字环境主要服务于机器人训练和评估; WorldLabs擅长生成模型、计算机视觉和三维重建,SceniX则拥有机器人学习、硬件和物理仿真方面的积累。 她认为,未来的机器人基础模型很可能是一个包含“动作”的多模态模型:既接收视频、文字、图像等信息,也输出世界状态和机器人动作。
2026年07月31日 19:16

大语言模型的突破,很大程度上建立在互联网规模的文本数据之上。但机器人没有自己的“互联网”:真实世界的数据采集昂贵、缓慢且危险,也很难覆盖实际部署中可能遇到的各种意外情况。

7 月 21 日,李飞飞创办的空间智能公司 World Labs 宣布收购机器人仿真初创公司 SceniX,后者致力于把真实场景转化为可供机器人训练和评估的数字环境。

这笔交易公布后不久,李飞飞与 SceniX 联合创始人李昀烛(Yunzhu Li)做客了一档播客节目,详细解释了这笔交易背后的技术判断、讨论了仿真如何开启下一代机器人技术,以及训练机器人为何需要与训练语言模型截然不同的方法。

World Labs 还同步发表了技术文章《Building Worlds That Train Robots》,首次披露了 SceniX 的“真实-模拟-真实”路径的部分实验结果。

一次从客户开始的收购

去年年底,World Labs 发布世界模型产品 Marble,它可以接收文字、一张或多张图片,将其转换为具有几何一致性的三维世界。SceniX 随后注册使用了 Marble,成为 World Labs 的客户。

李飞飞起初并不知道这家公司与自己过去的博士后李昀烛有关。后来才发现 SceniX 是对方参与创办的公司,她专门打去电话:“原来这是你们的公司。”

随着交流深入,双方发现,两支团队正在从不同方向解决同一个问题。World Labs 擅长生成模型、计算机视觉和三维重建,SceniX 则拥有机器人学习、硬件和物理仿真方面的积累。前者可以帮助 SceniX 更高效地生成数字环境,后者则为 World Labs 补充了此前相对缺少的机器人与仿真能力。

图 | SceniX 创始团队(来源:SceniX) 图 | SceniX 创始团队(来源:SceniX) “双方的能力高度互补,同时又拥有共同的使命。”李飞飞说。她将 World Labs 定义为一家前沿模型实验室。公司试图构建的是 AI 的下一个前沿——空间智能,即让机器获得生成、理解和推理空间,并与物理或虚拟空间交互的能力。

在游戏、视觉特效和设计等领域,人们可以在虚拟空间里创造和互动;在物理世界里,机器人则要感知环境、理解物体关系,并预测行动产生的后果。两者背后依赖的,都是对空间和世界运行规律的理解。

李昀烛透露,SceniX 起初曾考虑继续独立发展,但在与李飞飞交流并看到双方的协同效应后,团队认为加入 World Labs 是更合理的选择。

当主持人问及 World Labs 是否会推出面向机器人的基础模型时,李飞飞没有否认这种可能。她认为,未来的机器人基础模型很可能是一个包含“动作”的多模态模型:既接收视频、文字、图像等信息,也输出世界状态和机器人动作。

李昀烛进一步解释,当模型把视频帧和动作作为输入时,它相当于一个前向模拟器,用来预测机器人采取某项动作后,环境会发生怎样的变化;当模型根据目标输出动作时,它又接近一个策略模型,负责判断机器人下一步应该做什么。

这意味着,机器人基础模型不能只理解眼前的世界,还要预测动作的后果,并决定如何在现实环境中行动。它也可以作为通用的基础模型,再针对不同机器人和具体任务进行微调。

给机器人造一个可以无限试错的世界

在解释这笔收购时, 李飞飞把问题指向了机器人领域最根本的瓶颈:数据。

语言模型能够从互联网获取海量文本,图像和视频模型也拥有相对丰富的公开数据。但机器人需要的不只是画面,还要知道采取了什么动作、环境如何变化,以及动作最终是否成功。

这些数据很难直接从互联网获得。在真实环境中收集机器人数据,需要实体设备、场地和人工操作。每一次训练和评估都必须等待机器人完成物理动作,失败还可能损坏设备或带来安全风险。这意味着,机器人很难直接复制大语言模型依靠数据和计算规模提升能力的路径。

“为了让机器人真正工作,我们必须以某种方式解锁缩放定律的力量。”李飞飞说,“但这些数据从哪里来?这是机器人领域每个人都在面对的深层问题。”

SceniX 尝试用“真实—仿真—真实”路径解决这个问题。

李昀烛介绍,这套路径先将真实环境映射到数字世界。数字环境不仅要捕捉场景的外观和几何结构,还要描述其动力学,即机器人采取动作后,环境将如何变化。 机器人可以在数字环境中训练和接受评估,再把学到的策略迁移回现实。 理想状态下,数字世界与真实环境需要保持足够的一致性:如果一种策略在仿真环境中的表现得到改善,回到现实后也应出现类似提升。

但传统的环境重建仍然较为笨重。李昀烛认为,Marble 及 World Labs 的其他技术可以帮助团队更高效地重建和生成环境。这也是团队选择加入 World Labs 的原因之一。

双方希望把一个现实任务扩展成大量数字场景。机器人不必只在少数人工搭建的环境中反复练习,而可以面对不同的物体位置、场景布局、光照、摩擦和机器人状态。

从具体用途看,这套数字环境主要服务于机器人训练和评估;从实际价值看,李昀烛将其概括为两点: 可靠性和效率。

可靠性来自对更多状态和异常情况的覆盖。在真实环境中,开发者很难系统改变光照、几何结构、摩擦和其他物理参数,也难以主动制造大量危险或罕见情况。模拟则可以有控制地生成这些变化,让机器人反复面对不同条件,观察策略在哪些情况下失效。

效率则体现在训练和评估的迭代速度上。目前不少机器人数据依靠遥操作采集,操作人员通过外骨骼等设备控制机器人,数据采集速度有时甚至低于人类直接执行任务。模拟环境可以并行运行训练,并系统性地加快机器人的动作,同时保留环境动力学的变化。

视频 | 双臂装箱(来源:World Labs )

同期发布的技术文章展示了部分早期结果。任务包括双臂装箱、线缆插接与整理、试管转移,以及从杂乱环境中抓取马克笔和铅笔等。按照 World Labs 的说法,部分策略完全使用模拟数据训练,没有使用真实世界训练数据,随后直接迁移到不同的真实机器人平台;其中一些策略在真实硬件上连续自主运行一小时,无需人工干预。在双臂传递方块的实验中,模拟评估基本保留了不同策略在真实硬件上的相对排名,也呈现出相似的成功与失败区域。

模拟会偏离现实吗?

随着视频生成模型不断进步,利用互联网视频训练机器人,已经成为机器人学习领域的一条重要路线。

但李昀烛认为, 一个供机器人使用的世界,关键不只在于视觉效果,而在于“一致性”。 它需要在空间、时间、不同视角和不同交互方式下保持稳定。如果机器人正在推动一个物体,物体却在生成结果中突然消失,这个世界就无法提供可靠的训练信号。

对于普通视频而言,短暂的画面错误或许不会影响观看;对于需要据此决定下一步行动的机器人而言,同样的错误可能直接导致任务失败。机器人需要知道的不只是“下一帧看起来怎样”,还包括“采取这个动作后,世界将如何变化”。

不过,仿真也不必复制现实中的所有细节。李昀烛以四足机器人为例:机器人要学习在雪地和灌木中行走,模拟器不需要精确还原每片雪花和每根树枝,而要保留与任务有关的基本结构,并通过不断改变地形和物理条件,让机器人获得迁移到现实的能力。

因此,仿真所需的保真度取决于具体任务。 机器人需要的不是一个在所有细节上都完美的世界,而是一个抓住关键规律、能够支持训练和策略迁移的世界。

主题:机器人|世界|李飞飞|一个|公司|语言模型