具身智能企业密集发布模型多元化探索“大脑”进阶路径
具身智能企业密集发布模型 多元化探索“大脑”进阶路径
2026年09月23日 06:5
● 本报记者 郑萃颖
近日,具身模型不断上新。人形 机器人 公司Figure发布其研发的神经网络模型Helix 2.5,能让 机器人 自主操作家务;宇树科技、北京松延动力科技集团股份有限公司相继发布新具身模型,并对外透露模型训练策略。
从业者认为,随着具身模型的技术路线更为清晰,具身 机器人 本体硬件相对成熟,具身模型研发进入关键期。企业搭建强化学习实验场、推动模型创新、探索训练数据配方,推动具身 机器人 性能更进一步。
行业重心转向模型研发
机器人 新款产品的发布已经不再是具身智能行业的焦点,关注点正在从“躯干”转向“大脑”。当地时间9月17日,海外 人形机器人 公司Figure发布其最新研发的神经网络模型Helix 2.5,实验结果显示,搭载Helix 2.5的Figure 03 人形机器人 可以在陌生环境进行自主作业,穿过狭小的空间,整理客厅和床铺。Figure表示,Helix 2.5使用更少的专用数据,实现了更强的泛化性,这意味着 机器人 通过模型训练学习到的任务执行能力可以迁移到不同的新场景。
国内具身智能行业也在将更多资源集中投入到具身模型的研发上,包括宇树科技、松延动力这两家最早以机器人本体量产能力为消费者所熟知的公司。
9月10日,宇树科技发布全新一代通用 人形机器人 基础模型UnifoLM-WLA-1.0并宣布开源,该模型依托大规模通用多模态感知与理解数据,融合了以交互为中心的世界建模技术,可驱动机器人完成64项操作任务。视频中,宇树科技展示了机器人自主执行收纳工具箱、叠毛巾、向洗衣机投放衣物等日常任务。宇树科技董事长王兴兴在今年8月举办的2026世界机器人大会上表示,公司曾在2024年初开始推进基于视频生成技术的世界模型开发,后由于效果不理想而短暂搁置,自2025年起,公司再次大力发展世界模型。
以万元级机器人“小布米”以及仿生机器人为代表产品的松延动力,于9月8日对外发布首个自研具身智能模型“HERON-World Model”;9月15日,发布第二个自研具身智能模型“HERON-CRA”。公司创始人、董事长姜哲源告诉记者,公司自去年8月组建具身模型研发团队,今年团队逐渐形成战斗力,目前公司大部分投入流向模型研发部门。
“2023年公司成立之初,全球除了波士顿动力公司,缺乏能稳定行走的人形机器人本体,因此我们优先补齐了硬件和运控的短板。如今,机器人本体在成本、可靠性、性能等方面已准备就绪,具备规模化基础,现在是补齐‘大脑’短板的合适时机。”姜哲源表示,2023年至2024年,具身模型的技术路线较为分散,而如今,行业对于世界模型与VLA路线融合的方向形成一定共识,成为具身模型研发的阶段性拐点。
多元探索模型训练路径
为了让机器人更智能,企业正在探索不同的具身模型训练路径。
在北京石景山区的一栋办公楼中,其中一层放置了海洋球、障碍物,地面绘制了彩色跑道,都使用了不易造成磕碰损伤的材质,看起来就像是个幼儿园。但在这里“上学”的不是小朋友,而是机器人。
今年9月,北京他山科技有限公司与2024年图灵奖得主、“强化学习之父”理查德·萨顿(Richard Sutton)团队Openmind联合共建的机器人强化学习实验场正式启用。首批不同形态机器人开始入场进行强化学习实验。在这里,不同企业的具身机器人在场地中自主行走,尽可能长时间地与环境交互。
他山科技CEO马扬表示,具身智能的未来需要多种学习方式,在真实物理世界中通过自主触摸和试错获得成长,是其中重要的进化路径。他山科技研发副总裁侯广东向记者介绍,第一阶段,机器人将在实验场内适应环境变化,以“延长在线时间”“减少损伤”为目标,长时间与环境互动,并自主完成充电,这一基础能力可以让机器人未来在家庭等非结构化场景中具备自适应能力。后续,研发团队逐步引入更复杂的算法与实验设计,让机器人建立自我认知、区分自身与外界、掌握运动控制、理解物体交互、最终实现多智能体间的协作。
“我们的目标是开发出能够赋予机器人学习能力的模型,而非对单一技能做固化编码,让机器人执行。”侯广东表示。
浙江人形机器人创新中心首席科学家熊蓉认为,当前具身模型发展的根本瓶颈在于模型的泛化能力,而提升模型泛化性的一大挑战在于,训练中使用的仿真生成数据与现实物理世界难以对齐。
“这就涉及视觉、力觉、触觉信息,机器人全身状态及环境信息的统一表征问题。”熊蓉表示,浙江人形机器人创新中心实现视力触融合的统一表征,使得机器人在仿真世界中训练的模型能力能准确对应到真实世界;在模型学习上,将预测模型与行为模型相结合,具身模型与世界模型协同进化。
松延动力摸索出了“喂养”模型的数据配方。姜哲源介绍,公司部署了数据采集基础设施,通过自采与合作采集相结合,以第一视角无本体采集数据为数据底座,结合仿真数据、真机遥操作数据,训练模型能力。模型能力达到拐点,预计至少需要百万小时量级的数据,数据的多样性至关重要。
具身模型发展进入关键期
当前,虽然具身机器人已经进入一些工厂产线、药店、零售店等真实场景,但仍处于实验阶段,通过真实场景部署获得训练所需数据,类似自动驾驶发展早期。对于模型发展的进度,从业者有着不同的判断。
王兴兴在此前公开演讲中谈道,具身智能领域“ChatGPT时刻”存在着明确的标准:即当机器人被部署至家庭等各类陌生环境,通过语音指令可实现80%的任务,这就意味着具身智能产业迎来爆发的临界点。这一时刻有望在不久的将来到来,他判断,快则两至三年,慢则五到十年。
北京极佳视界科技有限公司首席科学家朱政则认为,相比如今被广泛使用的语言模型,具身模型的发展过程,不一定会存在某个“令人惊喜”的瞬间。“语言模型是在数字世界做交互,输出文本,更容易让人感受到惊喜的变化;具身模型需要在与物理世界的交互中持续地演进,很难会在某个瞬间制造惊喜。”朱政表示,随着行业资本持续涌入、专业人才不断集聚,国内世界模型产业有望迎来跨越式发展。
国内具身模型的发展正在加速。从数据看,国内具身模型的创业企业数量、融资规模明显增长。IT桔子数据显示,2026年至今,国内获得融资的具身模型公司数量超过140家,是去年同期的1.5倍;融资总额超过1000亿元人民币,是去年同期的三倍多;单笔融资均值也高于往年。
(文章来源:中国证券报)