头部机器人厂商竞逐“大脑”,王兴兴:行业“ChatGPT时刻”至少还要2年
竞争的焦点正在从机器人的身体进一步向“大脑”延伸。
作为机器人产业年度盛会,今年世界机器人大会(WRC)的一个明显变化是,竞争焦点正在从机器人的身体进一步向“大脑”延伸。
时代周报记者现场了解到,多家头部企业正在加码机器人的智能中枢。与此同时,机器人的形态也在迅速摆脱“双足”这一单一路线,轮式机器人、移动底盘、固定式机器人等形态并存。
极佳视界创始人、CEO黄冠表示,过去三年多,AGI正在深刻改变社会与产业。但当前的AGI更多集中在聊天机器人、代码生成和Agent等领域。AGI不应该只有语言智能,更需要世界智能,需要具备在物理世界中理解、生成、预测和行动的能力。
在他看来,继语言模型之后,通用世界模型正在成为AGI的最新前沿。
因此,行业竞争正在从机械结构、运动控制等“身体能力”,逐渐延伸至感知、决策与执行背后的“大脑”。
“具身智能与传统 AI 最大的不同,在于智能最终必须通过机器人的身体作用于真实世界。”仙工智能现场工作人员向时代周报记者表示,模型不仅要理解是什么、做什么,还必须进一步解决怎么做、如何稳定地做。
这意味着,机器人的“大脑”不仅需要更强的理解能力,还需要与不同的身体、环境和任务建立连接。
普渡机器人具身智能产品线总经理吴翔向时代周报记者表示,基于一脑多形技术架构,不同形态的机器人共享一套统一的底层模型和软件架构,实现跨本体、跨场景的能力迁移与复用。
从双足走向多形态,再从单机智能走向一脑多形,机器人产业的竞争边界正在被重新定义。机器人的终局或许并不只是拥有一副越来越像人的身体,而是拥有一个能够理解真实世界,并被不同身体调用的通用“大脑”。
机器人ChatGPT时刻
机器人行业正在等待自己的“ChatGPT时刻”。
在WRC现场,宇树科技创始人王兴兴谈到,目前具身智能最大的瓶颈,并不是机器人“不会做”,而是“最后几厘米”做不好。
“最后一点点触觉、最后一点点误差,它没办法很好地去修正。”王兴兴表示,这也是目前全球具身智能面临的最大瓶颈之一——AI模型的输入、输出,与真实物理世界之间仍存在偏差。
王兴兴认为,目前不少AI模型在固定场景、经过充分采集和训练后,成功率可以接近100%。但一旦物品或环境发生变化,成功率就会明显下降。
“快可能两三年,慢则五年甚至十年,机器人能够进入家庭等陌生环境并完成约80%的任务,才可能迎来具身智能的ChatGPT时刻。”王兴兴表示。
黄冠的判断相对接近。他认为,未来两到三年,大部分普通难度任务将被通用机器人解决,行业有望迎来类似GPT-3、ChatGPT的关键时刻;三到五年,高难度、长程任务将接近或达到人类水平;五到十年,机器人将进入本体与模型协同自进化的阶段。
机器人“大脑”比拼
如果说机器人企业的共识在于让机器人“自己进化”,那么不同企业正在尝试回答另一个问题:机器人的大脑究竟应该长什么样?
在具身智能方向,极佳视界以通用世界模型为核心,提出物理AGI的算法—数据“双金字塔”体系。算法金字塔包括世界模拟、动作对齐、经验强化三层;数据金字塔则从互联网视频、真人异构数据,逐步延伸至世界模型模拟器、仿真合成数据和高质量真机数据。
仙工智能则在尝试推进机器人大脑通用化,持续升级大脑载体,扩大模块化机器人生态,并增加对具身模型的投入。该公司同时提出阶梯计划:计划到2030年,与生态伙伴一起实现100万台具身智能机器人落地,覆盖多种本体形态,可在各类真实场景中持续执行多样化操作任务。
而智平方公关负责人戈振伟向时代周报记者表示,智平方早在2023年就明确端到端VLA路线。公司的判断是,世界模型不是VLA的替代者,而应该成为VLA的增强组件。
世界模型擅长预测物理环境的变化,可以提供包含时间维度的4D预测能力,但这还不足以解决所有问题。
例如,“泡茶先拿茶包再倒水”“做咖啡先拿杯子再接水”,看起来是简单的动作,却涉及长程任务规划,需要语言模型的逻辑能力。在智平方看来,只有把世界模型融入VLA,机器人才能同时具备短程物理预测和长程任务规划能力。
同样是深圳企业,在自变量看来,VLA和世界模型最终可能走向融合,但目前行业仍处于快速演进阶段,尚未到能够对技术路线下定论的时候。
自变量现场工作人员向时代周报记者表示,公司目前既有VLA模型WALL-OSS-0.5,也有世界模型WALL-WM。前者强调统一视觉与动作表征,后者则以“事件”为单位对齐视觉、语言和动作,并预测动作带来的状态演化。
从宇树科技、极佳视界,到仙工智能、自变量、智平方,不同企业的技术路线并不完全相同。有人押注世界模型,有人押注VLA,有人尝试让两者融合,也有人把重点放在模型自进化和机器人生态上。但这些路线背后正在形成一个越来越清晰的共识:机器人下一阶段的竞争,不再只是比谁的身体更强,而是比谁的大脑能够更稳定。
不同“身体”能否复用?
本届WRC上,从机械臂、人形机器人、机器狗,到轮式机器人、固定式机器人、外骨骼,越来越多企业开始同时布局不同形态的机器人。相比过去围绕双足、人形、灵巧手等硬件参数展开竞争,产业正在出现另一个变化:身体可以不同,但背后的智能能否被复用?
仙工智能提出的判断是,“身体可以不同,大脑能够连接;任务可以不同,能力能够调用。”这也是机器人的“大脑”从传统控制系统走向具身智能基础设施的关键一步。
海尔正在尝试用不同的“身体”解决不同的家务。本届WRC,海尔带来AI家用烹饪机器人、AI外骨骼机器人、海娃清洁机器人以及海娃家务机器人等产品,覆盖轮式、固定式、外骨骼、人形等多种形态。
这些产品的形态并不相同,但背后指向的是同一个问题:家庭场景并不存在一种“万能身体”,不同任务需要不同的身体。
海尔具身智能研发负责人李欣向时代周报记者表示,机器人的本体设计,是根据不同家务任务的需求进行的,包括机器人的高度、臂展等硬件参数;软件和具身模型则以海尔多年积累的家庭场景数据为基础,训练自己的具身模型。
“机器人实际要在垂直场景里面去完成。”李欣表示,例如将衣服放进洗衣机、将食物分类放入冰箱等,都需要在真实家庭场景中进行持续打磨和数据采集,最终训练形成具身大模型。
相比海尔从家庭场景出发,普渡机器人则在不同商用场景中铺开机器人形态。目前,普渡已经完成专用机器人、类人形机器人和人形机器人等多种形态布局,并形成配送、清洁、工业和通用具身智能四条产品线。
吴翔表示,公司的思路正在从单一产品展示走向场景化解决方案交付。普渡不只是展示机器人的运动能力,而是以消防、电力、工业等具体行业场景为载体,呈现完整的解决方案与落地价值。
这背后,是机器人产业竞争逻辑的一次变化。机器人最终可能不只有一种身体,但需要有一个能够连接不同身体、调用不同能力的大脑。