动作
分类
解码器
它通过动作到噪声的近似反演,将人类纠正转换成噪声监督,使监督学习和强化学习能够共同更新同一个轻量noiseactor,而预训练VLA的动作解码器始终保持冻结。
文章
模型
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习2026年09月02日10:30机器之心Pro视觉-语言-动作模型(Vision-Language-ActionModel,VLA)正在成为机器人操作的重要基础模型。
文章
因此,人类纠正和强化学习不再分别修改动作模型的不同部分,而是通过同一个噪声接口更新同一个actor。
文章
噪声
研究者还比较了两种替代方案:一种把噪声本身当作优化变量,通过梯度搜索能够重建人类动作的噪声;
文章
动作
人类动作与噪声空间之间,缺少一个可靠的接口。
文章
UniSteer的核心思路并不复杂:既然冻结的VLA定义了从噪声到动作的映射,就沿着这条路径反向寻找产生人类动作的初始噪声。
文章
UniSteer给出的答案,是把人类动作反演为初始噪声,让监督学习与强化学习在同一个轻量noiseactor上汇合。
文章
于是,UniSteer可以从人类动作开始,逐步逆转每一个Euler去噪步骤,最终恢复对应的初始噪声
文章
这就把问题收敛为一个关键技术问题:能否找到一个噪声,使冻结的VLA恰好生成接近人类纠正的动作?
文章
初始噪声