登录

IROS 2026最佳移动操作论文候选:ULTRA让人形机器人根据目标行动


速读:动作跟踪提供一套逐帧参考:身体怎么动、物体如何移动,都有明确的轨迹。 通过强化学习,重定向策略在尽量保留人体动作与操作意图的同时,考虑动力学和接触约束,生成在仿真中可执行的机器人轨迹。
2026年09月25日 11:0

把一个箱子从地上搬到指定位置,对人来说,是一件普通的小事。对人形机器人来说,却是一道全身协作题。

走近时要调整站位,下蹲时要保持平衡,双手接触箱子后要稳稳托住,起身和移动时还要协调双腿、躯干与手臂。任何一个环节出错,都可能让箱子滑落,甚至让机器人失去平衡。

一种办法是提前准备好完整的参考动作,让机器人逐帧跟踪。但如果只给出箱子的目标位置,中间的动作该如何产生?

能不能用同一个控制器,既在有参考动作时精确跟踪,也在没有参考动作时,根据感知和任务目标完成操作?

这正是  ULTRA  想解决的问题。

我们提出了  ULTRA ( Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation ),并在  Unitree G1  人形机器人上进行了验证。该工作已被  IROS 2026  接收,并入选  IROS 2026 Mobile Manipulation Paper Award  候选论文。

一个控制器,接受不同「详细程度」 的指令

我们先区分两种控制需求。

动作跟踪 提供一套逐帧参考:身体怎么动、物体如何移动,都有明确的轨迹。机器人要尽量准确地复现这些动作。

目标驱动控制则只规定希望达到的结果,例如物体的目标位置与朝向,把中间动作留给控制器生成。这就是「稀疏目标」:它没有逐帧规定机器人怎样迈步、弯腰和抬手。

ULTRA  将这些需求放进同一个控制框架: 这些能力由同一组策略参数实现 。 控制器还可以使用不同的 感知输入 ,包括外部动作捕捉系统提供的物体状态,以及机器人自身深度相机获得的信息。

这里的「自主」,具体指在给定目标和可用感知的条件下生成动作。目标仍需外部提供,而机器人不再需要别人提前规定每一帧应该怎么动。

人的动作不能「复制粘贴」,先让训练数据符合物理

这些全身协作能力从哪里来?一个重要来源是人体运动捕捉数据。

但人和机器人的身体比例、关节结构不同。同样一个搬箱子的动作,直接映射到机器人身上,可能出现手够不到箱子、脚底打滑,或接触关系不合理的问题。姿态看起来相似,并不代表动作能稳定执行。

ULTRA  为此引入了 物理驱动的神经动作重定向 。

可以把它理解为:让机器人在物理仿真中学习如何「用自己的身体」 完成示范中的动作。通过强化学习,重定向策略在尽量保留人体动作与操作意图的同时,考虑动力学和接触约束,生成在仿真中可执行的机器人轨迹。

训练完成后,同一个重定向策略可以处理新的动作,并通过调整运动范围和物体尺寸扩充数据,无需为每条新轨迹重新训练一套策略。

这样,人体动作就转化为后续控制策略可以学习的训练材料。

下面的视频可以重点观察:同一个人体动作如何转化为机器人的全身运动,以及物体尺寸和运动范围变化后,手、脚与物体之间的配合如何调整。

主题:机器人|动作|控制器