登录

CoRL 2026重磅开源!Sharpa世界联觉模型实现真实扰动鲁棒手内操作


速读:而一旦遇到真实深度噪声、形状变化和接触状态不可见,这些策略就容易退化成近乎开环的“手指套路”。 整套系统以Dreamer风格RSSM为核心,搭配干净深度重建、动作条件循环推理、PPO非对称Actor-Critic与可复用预训练先验,在人形尺寸22-DoF五指灵巧手上实现扰动鲁棒、物体ID无关的通用手内旋转。 连续旋转>1分钟。 3.1y轴旋转:工具型物体Sim-to-Real。
2026年09月17日 15:

灵巧手从 demo 走向真实应用,关键不只是 “会不会动”,而是能否在  noisy depth、稀疏触觉、外力扰动和未见物体 下稳定泛化。现有 in-hand manipulation 往往依赖固定物体、定初始位姿或理想传感器。而一旦遇到真实深度噪声、形状变化和接触状态不可见,这些策略就容易退化成近乎开环的 “手指套路”。

Sharpa Robotics 的研究团队提出的 World Synesthesia Model(WSM,世界联觉模型) 正是面向这一难题提出:它把视觉几何、触觉接触、本体感觉与动作历史统一到一个 可复用的世界模型状态 中,让策略持续推断手 - 物系统的隐含物理状态,而不是只匹配当前观测。

这项工作被  CoRL 2026 高分收录 ,其核心价值在于用 世界模型作为联觉先验 ,缩小真实传感器噪声造成的 vision gap,并把能力迁移到未见物体和真实平台扰动恢复中。

论文标题:World Synesthesia Model for Robust and Generalizable Dexterous In-Hand Manipulation

arXiv 链接:https://arxiv.org/pdf/2609.07002

项目主页:https://wmcraftnet.github.io/

代码链接:https://github.com/sharpa-robotics/WM-Craftnet

世界联觉模型驱动的真实硬件多物体 in-hand 旋转

1. 四大核心模块构成世界联觉模型一体化框架

整套系统以 Dreamer 风格 RSSM 为核心,搭配干净深度重建、动作条件循环推理、PPO 非对称 Actor-Critic 与可复用预训练先验,在 人形尺寸 22-DoF 五指灵巧手 上实现扰动鲁棒、物体 ID 无关的通用手内旋转。

世界联觉模型整体框架:Dreamer 风格 RSSM 多模态重建与策略接入 世界联觉模型整体框架:Dreamer 风格 RSSM 多模态重建与策略接入 1.1 多模态预测状态编码:视觉几何 + 触觉接触 + 动作历史

世界联觉模型将本体感觉、触觉、腕部深度分别编码后融合,训练时对深度输入施加噪声与 dropout,重建目标却是干净腕部深度 —— 迫使循环状态从真实噪声观测中恢复可用的手 - 物几何。部署时 Actor 同时接收当前观测与 WSM 循环特征 w_t = h_t,在部分可观测条件下持续推断物体姿态、几何、接触与滑移。

1.2 World Synesthesia Model:干净深度监督 + 循环记忆,缺一不可

消融实验清晰揭示机制来源 —— 性能增益来自干净几何监督与动作条件循环推理的耦合:

噪声深度监督 Return 708.0 vs 完整 WSM 753.3(+45.3);去掉循环输入后 705.4;逐帧潜变量策略仅 667.6——  干净几何 + 循环记忆 才是最佳组合。

训练奖励曲线

WSM 消融训练曲线

1.3 WSM 潜变量深度重建:从噪声输入恢复手 - 物几何

真实硬件腕部深度流噪声大、不完整,主要来自近距离工作条件下深度相机精度下降,以及大量 NaN 值造成的空洞;WSM 潜变量却能重建更干净的手 - 物几何。

真实噪声腕部深度

WSM 预测深度

1.4 可复用联觉先验:9 物体预训练,迁移至 49 新物体

九物体 z 轴预训练 WSM 作为可复用物理先验,3000 epoch 后平均旋转 9.37 ± 0.13 rad/episode(无先验 3.28 rad),掉落率从 6% 降至 0.3%。

WSM 循环状态 t-SNE

49 物体下游旋转

1.5 Sim-to-Real 闭环部署:真实平台扰动鲁棒旋转

真实 Sharpa Wave 平台对比:

连续多物体 rollout

OOD 恢复

扰动恢复

2. 多物体 z 轴旋转:一策略覆盖九种日常物体

鸭子

草莓

角块:连续旋转>1分钟

3. 多轴旋转、零样本泛化与工具使用

3.1 y 轴旋转:工具型物体 Sim-to-Real

y 轴旋转涉及更大力臂与不对称侧向力矩。真实硬件已在牙膏、螺丝刀等 elongated 物体上验证 y 轴闭环旋转:

牙膏 y 轴旋转

螺丝刀 y 轴旋转

3.2 重力不变旋转:掌姿变化下仍保持抓取

紧凑抓握(compact grasp)使物体更 securely 留在手中,掌姿变化时仍可维持接触与稳定旋转。

紧凑抓握多物体旋转

Sim-to-Real 掌姿变化

3.3 零样本未见物体 + 过程扰动 + 挑战初始位姿

九物体 z 轴策略直接零样本评估三种未见几何;过程扰动下十字块被推向掌心后 3–6 秒内调整回舒适工作区;挑战初始位姿时先扶正再旋转。

零样本未见三物体

过程扰动恢复

灯泡三指扶正后旋转

3.4 工具使用:目标平移 + 高速轴向旋转

目标条件平移

高速 in-hand 旋转

3.5 与主流基线的真实世界对比

真实 z 轴角块旋转:开环无反馈、纯触觉易侧翻、IHR 受噪声深度 OOD 影响、去噪深度 alone 仍无法长时稳定旋转;世界联觉模型的循环任务上下文让策略维持超过一分钟稳定旋转。

真实 z 轴角块:基线 vs WM-Craftnet

开环 Replay

无反馈,无法恢复可控旋转

Touch Dexterity

纯触觉,物体频繁侧翻

In-Hand Rotation

噪声深度导致 OOD 失稳

WM-Craftnet

稳定连续旋转 > 1 分钟

4. 为灵巧操作走向真实泛化提供新路径

这项 CoRL 2026 工作在 22-DoF 五指灵巧手上实现了 跨物体、跨旋转轴、具备扰动恢复能力的通用手内旋转 。相比任务完成度本身,更值得关注的是它对一个关键问题给出的回答: 预训练世界模型能否真正服务于真实灵巧操作,并提升策略泛化与 sim-to-real 能力?

首先是 可复用的联觉先验 :世界模型可以作为下游策略的通用物理先验,实现高效迁移与 scale up。WSM 并非针对单一物体或轨迹进行状态编码,而是在视觉、触觉、本体感觉与动作历史之间学习可迁移的多模态物理表征。预训练后,这一先验能够帮助策略快速适配  49 个新物体 ,说明灵巧操作的泛化不一定只能依赖更大的端到端策略,也可以来自 可复用的世界表征 。

其次是  sim-to-real 部署 :世界模型可以实时处理 noisy depth,缩小 vision gap。在真实手内操作中,腕部深度常伴随近距离噪声、遮挡与空洞。WSM 借助干净深度监督和动作条件循环记忆,从噪声观测中恢复更可靠的手 - 物几何状态,使策略在真实平台上仍能完成未见物体旋转与扰动恢复。

第三个更重要的 know-how 是: World Model 不一定要 “想象未来”,也可以先学会更好地 “理解当下” 。WM-Craftnet 并没有把世界模型主要用于长时域未来预测,而是将 WSM 作为一种 多模态世界状态表征 :把本体感觉、触觉、噪声深度和动作历史融合成对当前物理状态更完整、更鲁棒的 policy context。它在未见物体泛化和 sim-to-real 上的提升表明,对于真实机器人而言,World Model 的实用价值未必只是 dreaming the future,也可以是  learning a better representation of the present 。

综合来看,这项工作的意义并不只是 “给策略接入更多传感器”,而是证明了 视觉、触觉、本体感觉与动作历史可以被统一为一种可复用、抗噪且具有物理意义的世界状态表征,并进一步服务于策略学习与真实部署 。这为 World Model 在机器人中的落地提供了一个很实际的方向:从追求 “预测未来”,走向 构建更好的当下世界表征 ,进而支撑灵巧操作在更多物体和真实扰动条件下的稳定泛化。

主题:世界联觉模型