登录

人类


分类

视频

更通俗点理解,就是它有两个分工明确的大脑,一个「视觉大脑」负责理解视频、定位进度和预测未来场景,另一个「动作大脑」负责把视觉目标变成机器人动作:视觉大脑(Localization&Vision):先看懂机器人干到哪一步了,对应的人类视频到哪一步。
文章

比如用5847段人类任务视频和对应的机器人轨迹配对,让它学会把人的执行任务的画面翻译成机器的视角,好从人类视频学习。
文章

而出山之后,再遇到新任务,直接把人类视频当操作指南,边看边干就行。
文章

随后,三种基线通过监督微调学习新任务,HOST则通过一段人类视频获取新技能,再重新测试各自的旧任务表现。
文章

手臂

不强行模仿人类手臂的角度,只盯着需要实现的最终效果,然后从最终效果想象出动作。
文章

动作

不再模仿人类动作,而是想象结果、反推动作
文章

你可能会问:让机器人看视频,不就是对着人类动作照猫画虎吗?
文章

然后根据人类动作结果,脑补出将这个画面转换为机器人视角应当看到的画面(比如想象出水杯被夹爪拿起的画面)。
文章

让机器人直接复制人类动作,很难得到有用的结果。
文章

这样就绕过了「让机器人模仿人类动作」这个最难的跨越。
文章