登录

机器人伸手时,杯子被挪走了:LIBERO-MAX用22.4万次仿真检验动态可靠性


速读:机器人如何接受一场「考试」? 近年来,机器人开始使用视觉语言动作模型(VLA):输入摄像头画面和「把杯子放进托盘」这样的指令,模型便生成控制机械臂的动作。
2026年10月11日 10:17

设想这样一个场景:你让机器人把桌上的杯子收进托盘。它已经看到了杯子,机械臂正朝杯子伸过去。这时,旁边的人顺手把杯子挪开了几厘米。

对人来说,接着调整一下手的位置就好。对机器人来说,事情可能复杂得多:它之前看到的是旧位置,已经生成的动作也指向旧位置。如果继续执行,手就可能伸向一块空桌面。它能及时看到变化、调整动作,最后把杯子收好吗?

这个小插曲,指向了机器人走进真实生活时必须面对的问题: 环境会在机器人行动过程中改变,而任务还需要继续完成。

机器人如何接受一场「考试」?

近年来,机器人开始使用视觉语言动作模型(VLA):输入摄像头画面和「把杯子放进托盘」这样的指令,模型便生成控制机械臂的动作。一些模型还引入世界预测机制,尝试利用对后续场景的预测帮助行动。

判断这些模型做得好不好,需要一套共同的考试题。机器人评测基准提供标准化任务和仿真环境,让不同模型在相同条件下接受测试,再比较谁能完成更多任务。

已有很多鲁棒性评测会在任务开始前改变条件,例如换一个杯子位置、调整光照或改变视角。机器人从第一眼起,看到的就是调整后的场景。

但「杯子一开始就在另一边」和「手伸到一半,杯子才被挪走」,对机器人提出了不同要求。后一种情况下,机器人已经根据旧画面采取行动,还可能有一串尚未执行的动作。 它需要在已有的执行过程上,继续应对新的情况。

围绕这一问题,来自  Stanford、CMU、MIT、UIUC 和 UT Austin  等机构的研究者提出了  LIBERO-MAX ,将执行过程中的环境变化变成可重复、可比较的测试。

该工作已入选  NeurIPS ’ 26 Robotics World Modeling Workshop 口头报告(Oral) 。 Yunbei Zhang  与  Zijian Jin  为共同第一作者,合作作者包括 UT Austin 教授  Peter Stone 、Stanford 教授  Marco Pavone 、MIT 博士后  Weirui Ye  和 NTU 助理教授  Jianfei Yang 。

主题:机器人|看到|动作|场景