人类
分类
视频
更通俗点理解,就是它有两个分工明确的大脑,一个「视觉大脑」负责理解视频、定位进度和预测未来场景,另一个「动作大脑」负责把视觉目标变成机器人动作:视觉大脑(Localization&Vision):先看懂机器人干到哪一步了,对应的人类视频到哪一步。
文章
比如用5847段人类任务视频和对应的机器人轨迹配对,让它学会把人的执行任务的画面翻译成机器的视角,好从人类视频学习。
文章
而出山之后,再遇到新任务,直接把人类视频当操作指南,边看边干就行。
文章
随后,三种基线通过监督微调学习新任务,HOST则通过一段人类视频获取新技能,再重新测试各自的旧任务表现。
文章
手臂
不强行模仿人类手臂的角度,只盯着需要实现的最终效果,然后从最终效果想象出动作。
文章
动作
你可能会问:让机器人看视频,不就是对着人类动作照猫画虎吗?
文章
然后根据人类动作结果,脑补出将这个画面转换为机器人视角应当看到的画面(比如想象出水杯被夹爪拿起的画面)。
文章
让机器人直接复制人类动作,很难得到有用的结果。
文章
这样就绕过了「让机器人模仿人类动作」这个最难的跨越。
文章