动作
描述
脑桥,负责把大脑的决策翻译成小脑的动作指令。
文章
分类
过程中
但靠近之后,会发现真正困难的地方并不在于“做出动作”,而在于保持动作过程中的稳定。
文章
轨迹
借助这些数据,模型能够学习人类如何维持平衡、协调关节和完成连贯动作,再将运动能力迁移到机器人身上,无需提前写好整套动作轨迹。
文章
身体
解码器
它通过动作到噪声的近似反演,将人类纠正转换成噪声监督,使监督学习和强化学习能够共同更新同一个轻量noiseactor,而预训练VLA的动作解码器始终保持冻结。
文章
虽然
有时候一台机器人刚刚调整好姿态,对手已经移动到了另一个位置,挥拳动作虽然完成了,但判断距离出现偏差,拳头最终打了个寂寞,现场看起来像极了两个新手在互相试探。
文章
生成
如果把这些方法简单放在一起比较,就很容易把“系统层级”“模型结构”“动作生成方式”和“学习策略”混为一谈。
文章
LLM让机器人拥有了更强的语义推理能力,VLA开始连接语言、视觉与动作,Diffusion和FlowMatching改变了动作生成方式,WorldModel和LatentAction又试图建立更加紧凑的中间表示。
文章
一个VLA完全可以采用Transformer、Diffusion或FlowMatching作为动作生成模块。
文章
近年来FlowMatching又成为新的动作生成范式。
文章
模型
在不久前落幕的“2026世界机器人大会(WRC)”上,银河通用创始人王鹤提到一组对比数据:2025年,银河通用发布世界动作模型论文时,他能找到的相关论文只有他们一篇;
文章
真实机器人和端到端视觉—语言—动作模型(VLA)又把决策、平衡和关节控制耦合在一起。
文章
VLA更多涉及视觉、语言等多模态信息如何进入动作模型;
文章
因此,触觉、力觉、声音等信号开始进入机器人动作模型。
文章
它使机器人动作模型能够同时利用视觉环境、语言指令以及机器人状态等信息,让“看到什么”和“要做什么”进入同一个动作建模过程。
文章
论文没有简单按照VLA、Diffusion等模型名称进行分类,而是沿着一个动作模型的构建过程,将学习型低层动作建模拆成三个问题:
文章
随着机器人学习的发展,越来越多研究开始通过数据驱动方式学习动作模型,并进一步采用ImitationLearning、ReinforcementLearning以及Auxiliary-taskLearning等不同学习策略来获取和优化机器人行为。
文章
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习2026年09月02日10:30机器之心Pro视觉-语言-动作模型(Vision-Language-ActionModel,VLA)正在成为机器人操作的重要基础模型。
文章
因此,人类纠正和强化学习不再分别修改动作模型的不同部分,而是通过同一个噪声接口更新同一个actor。
文章
过去几年,具身大脑的主流答案是VLA(视觉—语言—动作模型),把视觉、语言和动作放进同一个端到端模型,让机器人从人类示范中学习下一步动作。
文章
在银河星脑内部,大脑采用银河通用率先提出的世界-动作模型(WAM)架构,将视觉语言模型的动作生成能力与世界模型的环境推演能力纳入统一框架。
文章
标注
光象科技将训练过程分成了几个阶段,互联网视频和没有动作标注的人类第一视角数据,主要用于建立模型对物理世界的基础认识;
文章
带有动作标注的第一视角数据,帮助模型学习动作发生后物体状态如何变化;
文章
最终
VLA更多描述视觉、语言与动作如何被组织和建模,而Diffusion或FlowMatching关注动作最终采用什么方式生成。
文章
数据
其中既有高精度动作捕捉,也有从互联网人类视频中重定向而来的动作数据。
文章
这套模型背后,是银河通用积累的约10万小时人类动作数据。
文章
这套模型背后有超过10万小时的人类动作数据。
文章
控制
在第二届世界人形机器人运动会上,太极项目成为现场比较特别的一个比赛,相比跑步项目的速度感,太极比赛更强调动作控制。
文章
如果说400米比赛暴露的是机器人高速运动中的稳定性问题,那么其他项目则展现了人形机器人在复杂动作控制上的另一面。
文章
指令
可以说,WALL-SS是少数画面预测会跟随动作指令的模型。
文章
或轨迹
这一层将环境观测、任务条件以及中间表示进一步转化为可执行的动作或轨迹。
文章
噪声
研究者还比较了两种替代方案:一种把噪声本身当作优化变量,通过梯度搜索能够重建人类动作的噪声;
文章
同时
面对这样的高手,它在完成动作的同时,还需要琢磨这一分怎么赢。
文章
过去主要由System2负责的目标维护、任务记忆和进度追踪,被进一步下沉到直接控制机器人行动的System1中,使得它们在持续输出动作的同时也能一直记住目标、保留上下文、判断当前任务进度。
文章
可靠
「半物理执行」:身体动作可靠完成、永不摔倒,但墙会挡住去路,脚会撞到家具,物体会被碰开,模型必须面对自己刚刚造成的新局面。
文章
动作
PolicyLearning关注如何把前面的输入和潜在表示真正转化为机器人动作。
文章
如何利用视觉、语言等多模态信息建模机器人动作?
文章
中间帧仅描述不同物理状态之间的视觉过渡,不仅占用大量的模型容量和计算资源,而且无法直接刻画机器人动作所要实现的物理结果。
文章
视频式WAM会同时预测机器人动作和未来视觉轨迹,模型通过未来画面学习物体运动、空间变化和接触关系,进而获得更丰富的时空先验。
文章
训练时,模型联合学习机器人动作和动作完成后的未来世界表征;
文章
如果把所有时刻放在一起排序,大量自由空间运动会淹没那些短暂但关键的接触动作。
文章
人类动作与噪声空间之间,缺少一个可靠的接口。
文章
UniSteer的核心思路并不复杂:既然冻结的VLA定义了从噪声到动作的映射,就沿着这条路径反向寻找产生人类动作的初始噪声。
文章
UniSteer给出的答案,是把人类动作反演为初始噪声,让监督学习与强化学习在同一个轻量noiseactor上汇合。
文章
于是,UniSteer可以从人类动作开始,逐步逆转每一个Euler去噪步骤,最终恢复对应的初始噪声
文章
这就把问题收敛为一个关键技术问题:能否找到一个噪声,使冻结的VLA恰好生成接近人类纠正的动作?
文章
有全国性商业银行人士向记者介绍,银行近期集体加大贷款核销的动作也是“不得以”。
文章
但无论长成什么样,它都需要看见环境、识别物体、规划动作。
文章
梅卡曼德最早想解决的,就是让机器人自己看清物体、判断抓取方式、规划动作路径。
文章
“我们加入了人类数据,引导机器人习得符合运动美学的挥拍轨迹,让机器人的动作不那么僵硬。
文章
外部控制系统不用给机器人铺设电线,只需要改变声音频率,就能选择究竟让哪个结构动作。
文章
通过小脑驱动,机器人的动作不再是机械、割裂的指令执行,而能够呈现出更加拟人、流畅、高动态的运动状态。
文章
但机器人的动作是3D的,“具体哪个关节需要动,动作的幅度是多少,这都比自动驾驶更复杂”,上述人士表示。
文章
因为是AI自主生成,机器人动作流畅度不及预编程脚本,但具备更强抗干扰能力。
文章
现场演示当中,宇树展示多模态端到端动作自动生成方案,依靠语音指令直接输出机器人动作。
文章
就在2025年,央视春晚上挥着手绢跳舞的机器人动作还显得僵硬笨拙,而到了2026年,机器人已能够完成连贯武术、精准编队、高难度动态走位,动作舒展利落。
文章
他告诉记者,在企业的操作间,工作人员正在调试一台人形机器人的动作、语速,数日之后它将前往江苏无锡“出差”,协助真人讲解PPT。
文章
陈瑞圣介绍,杭州星枢智能引进了动作捕捉设备,让机器人的动作更拟人,公司还考虑未来成立机器人表演团,以租赁方式开展巡演。
文章
@德康张刚佑的学员们分为虎、鹿、熊、猿、鹤五大“门派”,身着对应动物元素帽子,展示招牌五禽戏动作。
文章
换句话说,人类数据告诉机器人动作大致应该是什么样子,强化学习则帮助它找到适合自己身体的实现方式。
文章
这次演示正式展示了主角的战斗动作和部分敌人设计。
文章
初始噪声
之间
第二个问题:感知和动作之间,需要一个怎样的中间空间?
文章
模型能够学习当前观察与动作之间的映射关系,至于这些动作会给环境带来什么变化,相关信息通常被隐含地编码在模型参数中。
文章
事件
2026-06-12
苹果此前已经完成多品类硬件的价格上调动作,早在今年6月
文章
效果
按吕尧的解释,相当于把世界模型对动作后果的判断提前“蒸馏”进策略权重,以降低部署阶段的推理负担。
文章
HumanCLAW把这种能力称为「行动智能(ActionIntelligence)」:模型需要根据当前观察和此前动作造成的结果,持续决定身体下一步应该做什么。
文章
如果只是固定动作,机器人可以提前编程完成,但真正的对抗环境里,对手不会按照设定路线行动。
文章
多帧视频latent通常远大于对应的动作序列,它们会增加模型的序列长度、显存占用和训练负担。
文章
其它
Actuation-LevelControl:这些动作如何被稳定执行?
文章
其它