登录

机器人进家门就能直接干活?Figure AI宣称实现零样本全身泛化,但同行并不买账


速读:毕竟,Figure过去一年已经连续发布过多次机器人基础模型,不少人猜测,这次所谓的“AI突破”,可能会带来一次更明显的能力跃迁。 一天后,FigureAI公布了新一代人形机器人基础模型Helix2.5。 测试前,公司没有在这些住宅里采集机器人数据; 在模型架构、下游任务数据、训练方法和评测流程都保持一致的情况下,没有经过大规模人类行为数据集Index预训练的模型,在这些陌生家庭里的完整成功率只有约9%; 在他们看来,这与Figure对外宣称的“机器人已经能在陌生家庭里真正干活”并不完全匹配。
2026年09月18日 16:46

9 月 17 日,美国人形机器人公司 Figure AI 创始人 Brett Adcock 在 X 上留下了一句简短的预告:“我们在 Figure 实现了一项 AI 突破,并将在明天展示。”

这条有些神秘的消息迅速引发关注。毕竟,Figure 过去一年已经连续发布过多次机器人基础模型,不少人猜测,这次所谓的“AI 突破”,可能会带来一次更明显的能力跃迁。

一天后,Figure AI 公布了新一代人形机器人基础模型 Helix 2.5。 他们宣称,搭载这套模型的人形机器人,到了一个从未见过的家庭后,不需要现场采集数据,也不需要重新训练,就能直接开始干活。

(来源:X) (来源:X) 为了验证这一点,Figure AI 把 Figure 03 人形机器人带进旧金山湾区 30 栋此前没有用于训练的住宅,让它完成整理客厅、叠毛巾和铺床三类任务。测试前,公司没有在这些住宅里采集机器人数据;测试过程中,也没有针对新的房间布局、家具以及玩具、毛巾和床品重新微调模型。每类任务都由同一个固定版本的模型完成。

最终,Helix 2.5 在 420 次测试中完整成功 237 次,总成功率为 56%。其中,铺床成功率 67%,叠毛巾 62%,整理玩具 40%。

这套评测对“成功”的要求也相对严格。整理客厅时,13 至 15 个玩具需要全部被放进篮子;叠毛巾要求所有毛巾完成折叠并放好;铺床则要把两个枕头和被子整理到指定位置。只要任务没有完整完成,或者过程中超时、需要人工进行安全干预,都会直接计为失败。

Figure AI 还做了一组对照实验。在模型架构、下游任务数据、训练方法和评测流程都保持一致的情况下,没有经过大规模人类行为数据集 Index 预训练的模型,在这些陌生家庭里的完整成功率只有约 9%;经过 Index 预训练后,这一数字提高到 56%。

单看结果 ,从 9% 提高到 56%,进步的幅度确实不小。 但发布之后,一些争议的声音也接踵而至。

以 Sunday Robotics 联合创始人 Tony Zhao 为代表的一些机器人从业者,对 56%(237/420)的完整任务成功率提出了质疑。这意味着机器人完成一项完整任务时,仍有接近一半的概率失败。在他们看来,这与 Figure 对外宣称的“机器人已经能在陌生家庭里真正干活”并不完全匹配。

(来源 :X) (来源 :X) 某种程度上,这也触碰到了当前具身智能行业,尤其是家庭机器人亟待回答的一个问题: 一个还会频繁失败、需要较高容错的系统,是否能够被称为真正能够“干活”的机器人?

Helix 2.5,具体做到了什么?

抛开这些争议,我们先来看 Figure AI 这次发布的 Helix 2.5 到底做到了什么。

它的重点并不是让人形机器人第一次学会铺床、叠毛巾或者整理房间。Figure 此前的 Helix 02 已经能让机器人在室内连续移动,并协调视觉、双手操作和身体平衡完成长程任务。

Helix 2.5 真正往前的一步,是让这些已经学会的技能尽量摆脱对特定训练环境的依赖。

过去,很多机器人任务都需要先在最终工作场景中采集数据,再针对这个环境训练。换到另一栋房子,家具布局、物体位置和光照条件都变了,机器人往往还需要重新适配。Helix 2.5 则试图让机器人在别处学会任务后,直接进入陌生家庭继续完成。

Helix 2.5 试图改变这一流程,Figure AI 先用 Index 中的大规模人类行为数据对模型进行预训练,再用其他环境中的机器人数据,分别教它整理房间、叠毛巾和铺床。最后,再把机器人直接送进 30 个此前没有见过的家庭执行任务。

图|在 Index 上预先训练的 Helix 2.5 适应了三个全身操纵任务。(来源:Figure AI) 图|在 Index 上预先训练的 Helix 2.5 适应了三个全身操纵任务。(来源:Figure AI) Figure AI 将这种能力称为“zero-shot whole-body generalization”,即“零样本全身泛化”。

其实单纯的“零样本泛化”在机器人领域已经不算新概念。Figure 此前的 Helix 就展示过对未见物体的操作,其他机器人基础模型也一直在尝试让机器人迁移到新的物体和环境。 Helix 2.5 这次比较特别的地方,在于把这种泛化继续扩展到了人形机器人的全身长程任务。

以铺床为例,机器人并不是站在固定工位前完成一次抓取。它需要自己走到床边,根据床的位置和周围空间调整站姿,再用双手处理不断变形的被子;如果中途没有处理好,还可能需要重新站位,甚至绕到床的另一侧继续操作。整理客厅也是一样,机器人要在家具之间移动、寻找散落的物体,再不断调整身体位置完成抓取和放置。

而前面提到的 9% 到 56% 的成功率跨越,可以说明 Index 预训练在这种跨环境迁移中起到了明显作用。

Index 是 Figure AI 今年 8 月公开的大规模人类行为数据项目。Figure 希望让模型先通过大量真实世界中的人类活动,接触做饭、清洁、整理、搬运等行为,再用相对更少的机器人数据,把这些经验转化成机器人能够执行的动作。Helix 2.5 发布时,Figure AI 称 Index 每秒新增约 35 分钟的人类行为数据。

Figure AI 还表示,在一个与 Helix 02 的代表性任务比较中,Helix 2.5 大约只使用了此前一半的专项适配数据,就达到了相近的成功率,同时还能把这项能力带到 30 个陌生家庭。

不过,这次成果依然存在明显的局限。 首先,它目前证明得比较充分的是环境和物体泛化,还不是开放式的任务泛化。 机器人能够完成的,仍然是三个已经经过专门训练的任务。它还没有做到面对一个完全没学过的新家务,只凭语言指令或观察就直接学会并完成。

其次,让机器人进入训练集之外的新住宅工作,并非 Figure AI 首次做到 。机器人基础模型公司 Physical Intelligence 此前发布的 π0.5,就已经展示过移动操作机器人进入未见过的真实住宅,整理厨房和卧室,并连续执行 10 至 15 分钟的多阶段任务。

另外,56% 的整体成功率也说明这种泛化还远谈不上稳定。 虽然 Figure 的完整任务判定标准比较严格,一次任务只要有最后一步没完成就会被算作失败,但对于真正的家庭用户来说,最终关心的仍然是事情有没有做完。跨环境泛化已经出现,并不等于可靠性问题已经解决。

Figure AI 还公布了一个更有意思的实验。他们把它称为“Human-to-Humanoid Robot Transfer Scaling Law”,即从人类行为数据到人形机器人的迁移规模规律。

主题:机器人|模型|任务|Helix2.5|人形机器人|叠毛巾