机器人刷一段「短视频」,就能学会新技能?自变量HOST技术「神器」来了
教会一台机器人叠袜子,一共分几步?
摊平、对齐、折叠,再将袜口翻过来,这些看似简单的动作,过去机器人要学会,往往需要四五个小时的训练。但现在,只需一段数十秒的演示视频,就能快速掌握。
好家伙,这是哪来的东方神秘力量?
最近,自变量机器人发布了一套名为 HOST 的机器人学习框架。HOST 全称为 Human-to-robot One-Shot Skill AcquisiTion,也就是「人类到机器人单样本技能获取」。
有了它,机器人只要看一段 29 秒的人类演示短视频,就能当场上手干活,期间甚至完全不需要更新模型参数,也不必专门采集几十条机器人遥操作数据。
不仅技能获取速度比最快传统方案飙升了 500 倍,连成功率都实现了反超。更简单粗暴点说,高冷死板的机器人,光靠「刷视频」就能进化为全能管家。
机器人学习做家务,进入「刷短视频」时代
别看如今的具身机器人能文能武,各个都是练习时长两年半的练习生,但熟悉机器人的圈内人都知道,以前让 AI 学干一件新家务,到底有多费劲。
目前常见的模仿学习方案,仍依赖数据采集与模型微调。
怎么教?先请个专业工程师坐在遥操作台前,像玩极品飞车一样,手把手控制机械臂干上 50 遍。
这就完了?早着呢。这几十条数据还得拿去给模型做监督微调(SFT),一通离线「炼丹」下来,少说也要花上 4 个小时。
如果机器人真进了千家万户,同样是整理桌子,涉及的动作可能完全不一样。难道每碰上个新活儿,都得呼叫工程师上门服务,再等几个小时?
这笔账,怎么算怎么离谱。
但 HOST 这套方案,则对传统流程带来了明显改变。研究团队搭建了一个双臂机器人平台,测试了 50 项训练阶段从来没见过的全新任务(比如放水果、堆碗、擦盘子、插笔、叠袜子)。
不采集数据,不改通用参数,只给机器人看一段人类普通演示视频。结果它在 50 项新任务中全都有成功记录。在主要的测试任务中,仅观看一次数十秒的人类演示视频,学会技能的平均成功率达到了 62%!
AI 之间的差距有多大,直接看数据吧。
当前最强的微调基线,需要专业人员遥操作机器人完成 50 条示范,从采集数据到训练出新技能,通常要花 4 小时。HOST 让机器人只需要观看一段平均 29 秒的普通人操作的视频,不需要反复演示和微调,就能学会新技能。
相比监督微调的方案,HOST 需要的示范数量降至五十分之一,技能获取时间较最快的 SFT 基线缩短约 507 倍。
这下,机器人是真体验到了人类那种「看一遍就会」的快乐。
不再模仿人类动作,而是想象结果、反推动作
你可能会问: 让机器人看视频,不就是对着人类动作照猫画虎吗?
真没那么简单。人和机器的「手速」能一样吗?视频里人类小哥 2 秒钟就把杯子拿起来了,机器人的铁胳膊可能需要 5 秒。
如果硬卡视频播放时间,视频里的人都开始倒水了,机器人还在那瞄准杯把手呢,任务步骤越多,双方的偏差也会越明显。
于是 HOST 的研究团队想了个绝招:不看时间,看进度。他们把视频画面和机器人的动作,映射到同一个叫「向量空间」里,然后用动态时间规整算法自动对齐。简单说,就是给任务打上进度条。
不管人类用了 2 秒还是机器人用了 5 秒,只要双方都进入了「杯子已经被拿起」的状态,进度就算同步。这种操作,让进度误差从 0.079 暴降到了 0.006, 直接缩小了一个数量级。
这时,聪明的你可能又会想到一个问题:即便节奏对上了,人类与那些「铁疙瘩」之间仍然存在明显的身体结构差异。
比如人的手掌可以贴合杯壁,机器人的夹爪需要寻找合适的夹取位置。人可以捏住袜子的一角,机械臂还要考虑夹爪开合、运动角度和两只手臂之间的配合。
让机器人直接复制人类动作,很难得到有用的结果。
对此,HOST 想出了一套非常巧妙的解决思路:先让机器人从人类执行完任务的结果,「想象」出机器人执行完任务的画面,再根据画面反推出机器人需要动作的动作。为实现这个方案,HOST 还设计了一个核心策略模型——双专家 MoT 架构。 更通俗点理解,就是它有两个分工明确的大脑,一个「视觉大脑」负责理解视频、定位进度和预测未来场景,另一个「动作大脑」负责把视觉目标变成机器人动作:
视觉大脑(Localization & Vision):先看懂机器人干到哪一步了,对应的人类视频到哪一步。然后根据人类动作结果,脑补出将这个画面转换为机器人视角应当看到的画面(比如想象出水杯被夹爪拿起的画面)。
动作大脑(Action):负责把脑补出的机器人画面变成现实,计算机械臂怎么动才能达到目标。
不强行模仿人类手臂的角度,只盯着需要实现的最终效果,然后从最终效果想象出动作。这样就绕过了「让机器人模仿人类动作」这个最难的跨越。
当然,「单样本技能获取」容易让人产生误解,以为机器人此前完全没有接受训练。
但其实这里的 one-shot 指机器人面对一项新任务时,只需要接收一段人类演示,整个任务都是在「推理过程」中完成的,无需再为这项任务更新模型参数。支撑这种能力、让机器人能从视频学习的基础模型,依然经过了大规模训练。
机器人出厂前可是见过大世面的。
第一阶段主要使用机器人数据。会团队先喂给它 193462 条机器人轨迹以及对应的机器人执行任务视频(涵盖 229 项任务),让它尝试从机器人的任务视频中想象出结果,再拆解出自己这副钢铁身躯怎么动。
第二阶段再加入人类与机器人的配对数据。比如用 5847 段人类任务视频和对应的机器人轨迹配对,让它学会把人的执行任务的画面翻译成机器的视角,好从人类视频学习。
先利用规模更大的机器人数据建立任务理解和预测动作结果的能力,再用数量相对较少的人机数据完成能力的迁移,这样的好处是可以充分利用数据、降低对人机配对数据的依赖。
而出山之后,再遇到新任务,直接把人类视频当操作指南,边看边干就行。
学会叠袜子,也没忘了洗盘子
掌握新技能只解决了一半的难题,更关键的是,机器人学会新技能后,原来的能力能否保留,同样决定了它能否长期「有用」。
这就涉及到机器人一个极其令人头痛的痛点:灾难性遗忘。 比如用后训练微调教机器人,会改变模型的参数、侵蚀模型原本已经学会的技能。这会导致「狗熊掰棒子」,看似学会了叠袜子,但以前很溜的洗盘子反而退步了。
论文中也注意到了这个问题。论文选取了七项来自训练集、模型此前已经掌握的任务,包括取出瓶子、对齐袜子、堆叠杯子、整理包装材料、盖住中央物体、放置纸巾和排列花朵。
研究人员先测试 HOST 与三种监督微调基线在这些旧任务上的表现。随后,三种基线通过监督微调学习新任务,HOST 则通过一段人类视频获取新技能,再重新测试各自的旧任务表现。
在旧任务测试中,三种微调基线几乎被「灾难性遗忘」打回原形。 学完新任务后,π0.5+SFT 只保留了原有表现的 17%,就连旧技能保留率最高的 Wall-OSS+SFT,也只保住了 40%。