机器人伸手时,杯子被挪走了:LIBERO-MAX用22.4万次仿真检验动态可靠性
设想这样一个场景:你让机器人把桌上的杯子收进托盘。它已经看到了杯子,机械臂正朝杯子伸过去。这时,旁边的人顺手把杯子挪开了几厘米。
对人来说,接着调整一下手的位置就好。对机器人来说,事情可能复杂得多:它之前看到的是旧位置,已经生成的动作也指向旧位置。如果继续执行,手就可能伸向一块空桌面。它能及时看到变化、调整动作,最后把杯子收好吗?
这个小插曲,指向了机器人走进真实生活时必须面对的问题: 环境会在机器人行动过程中改变,而任务还需要继续完成。
机器人如何接受一场「考试」?
近年来,机器人开始使用视觉语言动作模型(VLA):输入摄像头画面和「把杯子放进托盘」这样的指令,模型便生成控制机械臂的动作。一些模型还引入世界预测机制,尝试利用对后续场景的预测帮助行动。
判断这些模型做得好不好,需要一套共同的考试题。机器人评测基准提供标准化任务和仿真环境,让不同模型在相同条件下接受测试,再比较谁能完成更多任务。
已有很多鲁棒性评测会在任务开始前改变条件,例如换一个杯子位置、调整光照或改变视角。机器人从第一眼起,看到的就是调整后的场景。
但「杯子一开始就在另一边」和「手伸到一半,杯子才被挪走」,对机器人提出了不同要求。后一种情况下,机器人已经根据旧画面采取行动,还可能有一串尚未执行的动作。 它需要在已有的执行过程上,继续应对新的情况。
围绕这一问题,来自 Stanford、CMU、MIT、UIUC 和 UT Austin 等机构的研究者提出了 LIBERO-MAX ,将执行过程中的环境变化变成可重复、可比较的测试。
该工作已入选 NeurIPS ’ 26 Robotics World Modeling Workshop 口头报告(Oral) 。 Yunbei Zhang 与 Zijian Jin 为共同第一作者,合作作者包括 UT Austin 教授 Peter Stone 、Stanford 教授 Marco Pavone 、MIT 博士后 Weirui Ye 和 NTU 助理教授 Jianfei Yang 。