登录

逛完WRC,我们发现机器人行业最该回答的5个问题


速读:与此同时,在人形之外,越来越多公司开始根据真实任务重新设计机器人形态。 加上全身遥操作格斗系统,操作者的动作能被精准复现,这套东西背后其实是宇树在攒具身智能的数据闭环。 它们不一定都最会制造声量,却分别代表了这个赛道正在发生的关键变化:本体形态的分化,通用模型的竞争,数据闭环的重构,以及关键零部件逼近「最后一厘米」。 它不是人形,也不是传统四足,而是把机器人技术和装备形态揉在了一起,直接冲着文旅、特种作业这类场景去的。 自变量在现场采访中强调,它的机器人已经进入实际应用:家庭机器人已经大规模服务用户家庭;
2026年08月21日 12:08

没来的一定要看,来了的不看等于白来。

作者| 白石 周永亮

编辑| 周永亮 李源

8 月 19 日,北京亦庄的空气里飘着一种奇怪的兴奋,这是 2026 世界机器人大会开幕的日子。300 多家企业、2000 多件展品,几乎把具身智能行业能拿出的东西都搬到了这里:大模型、本体、关键零部件、数据,应有尽有。

开幕当天,宇树科技敲钟上市,盘中市值一度冲破 4000 亿元,这可能是过去十年,中国机器人行业最接近「资本狂欢」的一天。过去,机器人公司更多活在实验室、融资新闻和 Demo 视频里;而宇树的上市,第一次给这个仍处在早期的赛道钉下了一个资本锚点。

除此之外,云深处科技进入交易所受理或审核环节;智元机器人则于 2026 年 7 月确认启动赴港上市流程。一级市场的热,正在向二级市场传导,具身智能不再只是技术想象,也开始被要求回答收入、交付、毛利和规模化的问题。

逛完整个展区,跟我们此前预料的一样,今年没有让所有人「哇」的时刻,更多的是 demo 的展示。宇树没有展示刚刚发布的、原地跳高 2 米、奔跑速度 12.66 米/秒的「超人」,展台上更多是已有产品在解锁新动作;众擎把八角笼搬进了会场,维他动力用二次元偶像的方式整活……热闹是真热闹,但很少有人再讲「颠覆性突破」这四个字了。

比起继续追问「什么时候会有奇迹」,更值得追问的是几个更朴素的问题:机器人是不是只能长成人的样子?具身智能的「通用性」到底走到了哪一步?数据,正在从一门算法生意,变成一门硬件生意吗?那些藏在指尖、关节和电机里的关键部件,又往前走了几步?

带着这些问题,我们在展馆里走了一圈,也和多家代表性公司深聊。它们不一定都最会制造声量,却分别代表了这个赛道正在发生的关键变化:本体形态的分化,通用模型的竞争,数据闭环的重构,以及关键零部件逼近「最后一厘米」。

银河通用的展台上,轮式、重载和双足三种完全不同形态的机器人,跑的是同一套具身基础大模型;维他动力反过来从真实使用场景出发,倒推出了它的第一款人形机器人 Vbot ATOM;自变量在物流分拣场景里,把效率做到了每小时 1816 件、准确率超过 98%;帕西尼,则把最初只解决「触觉」的技术方案,扩展成了覆盖全身的感知网络……

具身智能仍然早期,甚至比很多人期待的更早期。它正进入一个更艰难、也更有价值的阶段,谁能把模型、本体、零部件和工程能力形成一个闭环,谁才可能成为下一阶段真正有价值的公司。

01

机器人是不是只能是人形?

过去两年,具身智能的叙事被人形机器人高度占领:跳舞、跑步、打拳、马拉松,所有出圈事件几乎都长着一副人的样子。

但看完这届 WRC,你会发现,人形机器人的概念依旧延展,巨型、仿生、半人马……「像人」不再只有一种标准答案。与此同时,在人形之外,越来越多公司开始根据真实任务重新设计机器人形态。

今年 WRC 逛下来,宇树的人形这边确实拼得凶,带来了全新的格斗动作。G1 打格斗,组合拳、回旋踢、飞踢一套下来,靠的是全身关节的实时协调;H2 个头更大、关节输出更强,出拳抬腿更有分量感。两台机器人放一起看,正好是「灵活」和「力量」两种风格。

乒乓球互动也很值得一看,机器人得先「看懂」来球再决定怎么回,这比单纯耍套路更考验感知和决策的配合。加上全身遥操作格斗系统,操作者的动作能被精准复现,这套东西背后其实是宇树在攒具身智能的数据闭环。

但最显眼的还是 GD01,那台三米高、能载人变形的机甲。它不是人形,也不是传统四足,而是把机器人技术和装备形态揉在了一起,直接冲着文旅、特种作业这类场景去的。

在本届 WRC 上,Vbot 维他动力正式发布人形具身智能终端 Vbot ATOM,并同步开启预订。ATOM 值得注意的是,它并不是从概念样机起步,而是承接了 Vbot 在四足机器人「大头」上已经验证过的产品定义、量产交付和用户运营能力。

今年 5 月,AI 载物机器狗「大头」实现量产交付。到目前为止,这款产品已成为消费级具身智能销量第一,在真实世界中累计完成 126 万次大模型交互、23,700 公里用户伴随里程和 131,500 小时陪伴,过去三个月还完成了 4 次 OTA。对具身智能行业来说,这组数据的意义不只在于销量,而在于它证明 Vbot 已经让机器人进入真实用户生活,并形成了从交付、使用反馈到持续迭代的产品闭环。

基于「大头」的实践,Vbot ATOM 没有沿用传统工业人形机器人的思路,而是从家庭、零售、公共空间和办公服务等生活场景出发,反向定义产品形态。160cm 身高、180cm 臂展、95cm 腿长和 31 个本体自由度,决定了它具备接近真人尺度的服务能力;织物包覆、状态交互设计和静音足底,则让它在家庭和公共环境中显得更友好,也更容易被人接受。

技术层面,Vbot 还发布了「Vbot Embodied Genome|具身基因组」具身模型体系及三大核心模型,用于支撑交互理解、世界模型决策、跨本体进化和真实反馈回流。

由此来看,Vbot ATOM 的到来,不只是 Vbot 从四足机器人延伸到人形机器人,更意味着其正在把已经验证的产品化能力,带入更大的生活空间,推动人形机器人从本体展示走向产品化时刻。

未来不远机器人则完全围绕家庭需求设计,能够完成基础的家务,儿童陪伴,老人陪护,宠物照料等场景。目前他们已经进入 500 多个付费家庭,累计服务超过 5 万小时。

未来不远机器人还展示了他们在家庭场景的快速迭代能力,一个月前的 WAIC,它重点展示的是洗衣,叠衣,收纳等基础家务,而在 WRC 现场,则把场景扩展到厨房:搭载了全新一代自进化 WAM 世界动作模型的第二代全栈自研机器人本体 F2 端到端自主完成意面制作。

完整烹饪流程对机器人的协同能力、精准度、判断力要求极高:需要双臂高精度同步协同;应对不可逆流体操作,依靠视觉瞬时精准判断用量;同时需要灵活切换、抓取、置换多种厨具,还要自主学习翻炒火候等无标准答案的「人性化分寸感」。而未来不远机器人在现场不中断的连续烹饪展示了他们惊人的稳定性。

未来不远表示,他们从本体、大脑到硬件采取软硬件协同的全栈自研,因此在新场景的迭代更快。除了从轻家务逐步向重家务扩展,未来不远对于家庭场景需求的理解还包括覆盖儿童、老人和宠物的刚需场景,现场他们也展示了包括五子棋,象棋的各种棋类的操作,开饮料,互动类游戏,以及双机协同工作等等。极强的落地场景和互动性让他们的展位始终围满了人群。

自变量机器人目前的重点是家庭和物流两个场景。其中物流场景它没有用完整人形机器人和五指灵巧手,而是两条机械臂配合普通夹爪,处理形状、重量和材质随机的真实包裹。

它的机器人会根据包裹本身的物理特性决定怎么处理:小件直接抓取,重箱可以推,碰到没有面单的玩具熊等异形件,也会判断后续流程并自主处理。此前公开直播中,这套系统连续运行一小时,分拣效率达到 1816 件/小时,准确率超过 98%。

自变量在现场采访中强调,它的机器人已经进入实际应用:家庭机器人已经大规模服务用户家庭;物流分拣也已经进入头部企业。

02

具身智能的通用性走到哪一步了?

具身智能的通用性,或者说通用任务能力,指的是具身智能机器人是否能跨物体、跨环境、跨指令完成复杂任务,以及是否能在新场景里重新规划。 

从能力上,具身智能在通用性上已经跨过「单一动作展示」阶段,现在先进的机器人,能够完成多技能串联、状态跟踪,甚至可以在经历扰动后重新进行规划。

在智能上,具身机器人的通用性显然与模型有关,而目前模型的技术路线远未收敛。头部公司们开发的路线有端到端 VLA(视觉—语言—动作模型),WAM(世界动作模型),分层具身智能体操作系统,以及跨本体具身基础模型等。

其中,端到端 VLA/WAM 的代表是银河通用、千寻智能和未来不远。这一思路的共同点是尽量将视觉、语言、动作和部分状态预测放入统一模型或表征中。 

银河通用在 WRC 发布的双足人形机器人 Galbot ET1「银河·星仔」,它利用 Agent 互动自学习技能可以直接观察人的动作,再实时模仿舞蹈和高动态动作,它还集成银河通用「LATENT」高动态网球对抗规控运动学习框架,可实现真人感网球陪练。

支持 ET1 实时模仿舞蹈和打网球等连续拟人动作的,是 AstraBrain WBC,即银河星脑体系中负责全身实时运动控制的小脑基座模型。 

具体来说,舞蹈演员给出新的动作,ET1 通过视觉识别并提取人的实时运动轨迹,再把动作映射到自己的身体上。它是真的在实时模仿,不是从预先编排的动作库里挑出一条轨迹重新播放。

银河通用目前有双足人形机器人 Galbot ET1,还有 Galbot G1、S1 等不同形态的机器人。它强调用「一颗大脑跨本体、跨任务、跨场景」。这些的机器人在家庭、零售和工业这些场景都有各自的应用,但它们共享同一套具身智能基础模型,不同形态的机器人,拥有各自的运动控制系统,感知、任务理解、世界建模和行动规划能力却是可复用的。

银河通用在接受采访时提到,过去机器人进入一个新场景,往往需要围绕这个场景重新采集数据、重新训练;现在同一套基础模型已经开始在不同本体和任务之间复用。通过少量数据进行适配,轮式机器人能用,重载机器人能用,换到双足机器人上,大脑也不需要重新从头训练。 

未来不远此前基于 AVLA 构建视觉、语言与动作的端到端闭环,并在此基础上进一步推出 Self-Evolving WAM(自进化世界动作模型),让机器人不仅能够理解并执行任务,还能预测动作结果,并利用真实家庭中的执行数据持续迭代模型。 

未来不远表示,以洗衣场景为例,其模型基于几十种洗衣机进行训练后,已经可以泛化到数百种不同的机型、开门方式和按钮类型。类似的泛化能力也用于衣物,玩具等家庭物品,让机器人能够在不同家庭环境中完成动态变化的任务。

自变量重点展示其模型 WALL-B 的通用性:家庭服务和物流分拣两个差异很大的场景,运行的是同一个模型。WALL-B 将视觉、语言、触觉、动作和物理预测融合进统一网络,让机器人理解重力、惯性、摩擦等物理规律,并预判动作结果。 

分层式具身智能架构的代表性探索包括逐际动力 COSA。

COSA 0.5 将机器人大脑分为三层:System 2 负责场景理解、记忆、推理和任务调度,System 1 调用 VLA 等操作技能,System 0 以最高 1000Hz 进行全身运动控制。

主题:机器人|具身智能|问题|人形机器人