「触觉」会是具身智能感知世界的最后一块拼图吗?
视觉-语言-动作(VLA)模型将视觉与语言输入直接映射为动作序列,长期作为具身智能的主流基础框架。但仅依赖视觉和语言的大模型只能完成粗放、无接触、低容错的简单操作,面对需要精细物理接触的场景时精度受限,触觉感知的缺失使机器人难以感知接触力与表面物理特性。围绕触觉感知融入具身智能体系的方向,早期研究侧重于机器人本体硬件层面的优化;近期工作则在算法层面探索整合触觉感知的多模态融合、通用触觉表征构建等方案。
目录
01. 为什么没有「触觉」的机器人无法真正理解物理世界?
视觉具身框架存在怎样的物理感知边界? 机器人如何打破「看得懂」却「摸不准」的瓶颈? ...
02 . 近期探索如何从算法层面塑造机器人的「触觉神经」?
VLA+触觉?单独训练触觉感知模型?世界模型+触觉?...
03 . 触觉感知方案距离落地物理世界还有多远?
现有触觉感知方案存在哪些局限?培养触觉感知需要什么基础设施?...
为什么没有「触觉」的机器人无法真正理解物理世界?
1、近年来,视觉-语言-动作(VLA)模型成为具身智能的主流基础框架,依托大规模视觉-语言预训练,一定程度提升了机器人在非结构化环境中的任务适应性与长序指令执行能力。[1-1]
① 大规模视觉-语言预训练将高层语义理解与机器人动作指令对齐,实现了跨场景、跨物体的泛化操作能力。[1-1]
2、然而,面向精细物理交互场景,业界逐渐意识到 VLA 体系的局限性。研究者开始从多个方向拓展机器人的感知与控制能力,世界模型成为主流的优化方向,该模型弥补了传统 VLA 模型端到端映射、缺乏时序推演的缺陷。[1-2]
① 现有多数研究通过构建视觉世界模型,将其作为智能体的环境动力学模拟模块,依托视觉观测信息与候选动作序列,预测环境状态的时序演化过程,使机器人具备长时序规划能力。[1-2]
3、基于视觉的世界模型仅能表征物体空间几何结构与外观变化,无法捕捉接触力学相关信息,难以推断物体材质、摩擦系数、刚度等隐性物理属性,触觉模态的应用价值因而引起诸多关注。[1-3]
① 触觉可直接采集机器人与环境的接触状态、力学反馈及物体物理特征,能够补充视觉模态无法覆盖的物理交互信息,是完善机器人物理场景认知、支撑精细化交互任务的重要感知模态。[1-3]
4、相较于早期工作聚焦于触觉传感器的硬件研发与优化,近期工作着重于探索将触觉感知融入大模型与世界模型框架,实现触觉信息的标准化表征、跨模态融合与物理推理应用。[1-3]
① 早期触觉研究以硬件研发为主,重点提升触觉信号的采集精度与稳定性,但未接入大模型表征体系,也不参与智能体的任务决策与物理推理,仅作为独立的辅助传感模块使用,其交互信息的深层价值未得到挖掘。[1-3]
② VTLA、FTP-1、T-Rex、TouchWorld、Being-H0.8 等近期涌现的工作,分别从多模态联合推理、通用触觉表征构建、视触解耦控制、触觉预测分层架构以及隐式触觉预训练等方向,探索了触觉融入具身智能的不同技术路径。
近期探索如何从算法层面塑造机器人的「触觉神经」?
1、围绕触觉感知的融入路径,近期业界发展出多类方案,不同方案在模态融合方式、触觉表征范式、硬件依赖程度方面各有取舍。
2、VLA 模型缺少物理交互感知能力,许多工作选择在成熟的视觉 - 语言 - 动作框架中引入触觉支路,将触觉表征与原有多模态特征直接融合、统一训练,形成了 VTLA(Vision-Tactile-Language-Action)架构。
① 新智具身(NeoteAI) 联合 复旦大学在今年7月发布「N0-VTLA」\「N0-TWAM」 系列具有触觉原生特性的模型,在词元化阶段原生嵌入触觉时序 Token,形成以视觉为主导、触觉作为时序补充模态的多模态范式。[1-4][1-5]
② VTLA 将视觉、触觉、语言分别编码为 Token,送入共享 LLM Transformer 主干完成多模态联合推理;依靠模型内部原生的多头注意力实现跨模态信息交互,目标是建立视觉观测与触觉接触信息的关联,弥补纯视觉模型缺少局部接触感知的短板。[1-5]
③ 上海交通大学与派迅智能提出的「OmniVTLA」,设计双通路触觉编码器与语义对齐触觉 ViT(SA-ViT),实现不同类型视觉、力觉触觉信号的统一表征 ...
关注👇🏻 「机器之心PRO会员」,前往「收件箱」查看完整解读