对话原力灵机范浩强:为什么要用机器人「建造长城」?
具身的落地竞争,升级为系统能力之战。
作者丨 向 欣
编辑丨 高景辉
雷峰网 (公众号:雷峰网) 报道:
逛完今年的 WAIC,原力灵机展台上那座由数万块积木搭建的长城令人印象深刻。
4 台桌面机械臂和 2 台轮式机器人 Apex 联合作业 15 个小时 ,用近 8.2 万块微型积木拼出了一座 3.5 米长、1.5 米宽的长城模型。桌面机械臂以稳定的节奏拼接着微米级的积木块,轮式机器人滑行穿梭,负责上料、搬运和整体巡视。
这座微缩长城的 最小组件不到 1 厘米宽 ,拼装精度进入 亚毫米 区间,超越了人手自然抖动的极限。遇到偏差,机器人能自主感知、 即时纠错 ,重新调整姿态后再尝试。
原力灵机让人印象深刻的地方在于,精细操作、错误恢复、多机协同能力能在同一套系统里并行运转十几个小时。展馆里提全栈的厂商很多,但把这些能力串成一条完整作业线跑通的并不多。
他们是怎么做到的?我们在现场和 原 力灵机 联合创始人 范浩 强 聊了聊。展台上的动作只是表象,那些背后的技术判断和产业思考,更值得仔细琢磨。
01
拼一座长城,到底难在哪?
今年 WAIC 上,不少厂商直接把产线搬进展厅,试图用最直观的方式证明落地能力。原力灵机同样以工业落地为目标,却选了不太一样的展示方式:用积木搭长城。
理由很简单。工厂产线太专业了,普通观众可能会看不懂,更重要的是也提不起兴趣。积木就不一样了,人人都玩过。
形式是积木,逻辑其实是产线。 上料、装配、质检、下料、异常恢复……这些环节和工厂里的流水线一模一样。而积木本身也成了一个沟通工具:观众看到的是长城,潜在客户看到的是展商的能力边界。
这次积木长城的展项,系统展示了具身智能的三大能力: 精细操作、错误恢复、多机协作 。
积木的拼接公差是微米级的 ,远超机械臂自身的重复定位精度。机器人需要先靠视觉判断偏移方向,难点之一是,最后接触的那一刻,视觉已无法分辨,必须转而依赖其他感知方法。
原力灵 机的方案是在执行末端装上六维力传感器,它会和关节电流共同推断受力状态,决定是继续压还是停下来。
单做视觉、单做力觉都有人能实现类似的方案,其中难点在于 把多模态信号集成进同一个模型还能跑通 。 这背后是具身通用基础模型 DM0.5 的支持:它引入了历史关键帧实现分钟级任务记忆,训练中扩展了时序推理能力,推理速度在单卡 4090 上可达到 10Hz。
但真正花时间最多的地方,还不是精度,而是异常流的处理,即 错误恢复能力 。
很多人对工业场景的想象会有一个预设前提:机器人必须做到完美无缺,才有资格走进产线。但一个反直觉的事实是, 产线最看重的反而不是完美,而是在出错之后自己可以进行调整恢复,不让整条线停下来 。 这也更加贴合人类在产线中的工作状况。 毕竟百分之几的废品率可以接受,产线一停就是真金白银的损失。
现在大家展示的抗干扰能力,面对的情况其实有两种。一种是 人为制造的 ,例如用手电筒照一照改变光线,或者推一推物品改变位置,机器人再调整回来。不过这种变动未必和真实工况相符。
另一种则是 自然环境中自然产生的错误 。 例如,在这次积木长城的案例中,积木本身会有公差,有的凹槽紧一些,有的松一些,拼装过程中随时可能出现偏差,零件可能会崩出去,掉落到随机的位置,这些就属于自然产生的错误,很难预演。
原力灵机的方法是大量采集真实失败场景的数据,配合 RL 让模型从自身运行分布中学习。 其训练数据主要来自真机遥操作,每个月能采集数万小时的真实操作数据。
尽管他们也有使用仿真数据,但范浩强认为,一方面,在 GPU 里模拟一次,花的钱和能耗可能比真实做一次还大,另一方面, 地球其实是最好的模拟器 。
这套真机数据训练+RL 的模式,听起来门槛不高,但一层层拆开看,每一级都在叠加难度。100 台机器人同时采数据已经很难,还要带着算法一起采,本质上每个数据采集任务都是一个独立项目。原力灵机的DW0.5 世界模型在其中扮演后训练环境的角色,用帧级绑定和密集反馈机制加速了这个过程。
除此之外,6 台机器人还要协同工作。桌面机器人负责精细拼接,两台轮式机器人负责上料、下料和巡视。 整个调度由一个 Agent 完成,这个 Agent 直接调用了阶跃星辰最新的大模型。 它要感知谁缺料了、谁的组件完成了、整体进度怎么样,然后把任务分解成对原子技能的调用。