登录

动作


分类

解码器

其中,是冻结的VLA动作解码器。
文章

它通过动作到噪声的近似反演,将人类纠正转换成噪声监督,使监督学习和强化学习能够共同更新同一个轻量noiseactor,而预训练VLA的动作解码器始终保持冻结。
文章

模型

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习2026年09月02日10:30机器之心Pro视觉-语言-动作模型(Vision-Language-ActionModel,VLA)正在成为机器人操作的重要基础模型。
文章

因此,人类纠正和强化学习不再分别修改动作模型的不同部分,而是通过同一个噪声接口更新同一个actor。
文章

噪声

研究者还比较了两种替代方案:一种把噪声本身当作优化变量,通过梯度搜索能够重建人类动作的噪声;
文章

动作

人类动作与噪声空间之间,缺少一个可靠的接口。
文章

UniSteer的核心思路并不复杂:既然冻结的VLA定义了从噪声到动作的映射,就沿着这条路径反向寻找产生人类动作的初始噪声。
文章

UniSteer给出的答案,是把人类动作反演为初始噪声,让监督学习与强化学习在同一个轻量noiseactor上汇合。
文章

于是,UniSteer可以从人类动作开始,逐步逆转每一个Euler去噪步骤,最终恢复对应的初始噪声
文章

这就把问题收敛为一个关键技术问题:能否找到一个噪声,使冻结的VLA恰好生成接近人类纠正的动作
文章

初始噪声