独家|乐聚发布垂域具身模型:一倍工业提效,两项榜单第一
如果说,基础模型是具身大脑的“大学”通识课;那么,垂域模型则是机器人在工业领域的“专业课”。
作者丨董子博
编辑丨林觉民
今天要做世界模型,所有人都知道要做预训练,来让具身大脑变得更聪明;也知道要做后训练,让机器人可以在专门的任务下得到锻炼、做得更好。
和不少公司聊过, AI 科技评论发现,谈到中训练( Mid-train )的公司却很少。
而实际上,在具身的实际落地中,却存在一些原有方案不易解决的问题:当预训练的 VLA 模型,没法在具体的场景中发挥全部智能;而后训练却有时间、成本的门槛;在训练技能的环节,也容易出现数采、训练和调试的重复工作 ——VLA 落地要真正提效,中训练或许才是破局的良方。
AI 科技评论独家获悉, 乐聚机器人将推出面向工业场景构建的 “ 垂域具身智能模型 ”——KUAVO VLA 。 据了解,该模型以通用 VLA 基础模型为能力起点,使用 600+ 小时 KUAVO 同构型真机数据进行了中训练,将本体适配、基础操作和工业场景的共性能力沉淀到模型中。
乐聚机器人 KUAVO VLA 赋能下, 在不少场景中可以实现大约一倍的提效,在某些任务中甚至可以做到 100% 的成功率。
模型中训练,会成为具身工业落地的杀手锏吗?在这个仍然充满未知的方向上,乐聚机器人先趟出了一条路。
01
什么是“垂域具身模型”?
面对具体任务,基础模型的智能能够 完成 指令理解、任务规划、物理世界预测的要求,但要机器人实际可以执行任务,后训练往往需要投入千条以上的数据。
而为了填补这个鸿沟, “ 垂域模型 ” ,是乐聚机器人为 KUAVO VLA 做出的全新定义。垂域模型,就是通用基模和具身技能之间的 “ 中间层 ” ,相当于在基模与技能之间插入了一层针对工业场景的一轮中训练。
乐聚的思路是:先把 KUAVO 本体能力和工业场景中的共性能力训练进垂域模型,再把具体技能的学习范围收敛到工业场景。模型可以因此获得更高的能力起点 —— 达到相同技能效果时,可以减少重复的数据采集、训练和调试工作,把资源集中用于决定任务成败的关键差异上。新任务的开发逻辑,也因此从 " 重新学习 " 转变为 " 在已有能力上快速适配 " 。
在基模难以实际在本体中发挥智能时,垂域模型可以依靠详细训练过的 100 个 “ 工业共性能力 ” ,包括分拣、搬运、上下料、装配等典型操作,让模型省去繁复的后训练步骤,可以快速依靠 “ 原子动作 ” ,找到完成任务的方式,甚至实现能力的 泛化。
与跨本体混合训练不同, KUAVO VLA 训练的真机数据全 部来自 KUAVO 单一构型,使得模型能够持续、集中地学习同一套动作空间、运动特性和控制规律,减少不同本体之间的数据差异对技能学习的干扰。因此,模型的垂域能力能够与本体深度绑定,显著减少了模型在 KUAVO 上的推理误差,让本体的执行效率大幅提升。
总结下来,用简单的话来讲: 如果说,基础模型是 具身大脑 的 “ 大学 ” 通识课;那么,垂域模型 KUAVO VLA 则是机器人在工业领域的 “ 专业课 ” —— 一个人聪不聪明,得看通识课懂的多不多;但他能不能真的在实际场景干活,还得看他的专业课成绩。
在工业场景下,垂域具身模型的好处是显而易见的。
首先,它能够减少本体适配成本。通用 VLA 覆盖不同机器人本体和多种场景,数据中天然混杂大量跨本体样本;当模型进入 KUAVO 真机时,仍需重新学习本体的动作空间、运动特性和控制规律。
其次,它能减少场景端数据训练的成本。通用 VLA 模型面向开放泛化场景训练,需要采集海量多样化的现实场景数据,覆盖各类环境、物体、任务,数据体量巨大、采集标注成本高昂。而工业垂域具身模型聚焦特定工业任务与作业环境,无需对全量开放世界做泛化训练。可以复用工业现场真实作业样本,聚焦工位、物料、工艺流程做数据构建,大幅降低无关场景的数据采集、清洗与标注开销,实现用更少的数据完成任务收敛,提升模型训练的投入产出比。
此外,开发者训练新的技能不再需要从头开始,可以把资源和精力更多地投入到针对不同任务场景进行模型能力优化适配上,显著缩短了从基础模型到技能落地的开发路径。