国产最大端侧模型独角兽进军具身智能,发布开源首个具身系列模型
国产最大端侧模型独角兽进军具身智能,发布开源首个具身系列模型
2026年07月20日 18:41
国产最大的端侧模型 独角兽 面壁智能,7月19日在世界 人工智能 大会“智在终端惠及千行”分论坛,发布并开源了其首个具身智能技术成果——MiniCPM-Robot系列模型,包括一个视觉-语言-动作模型和一个跟踪导航模型,将团队长期主导的多模态能力首次从手机、 汽车 延伸至 机器人 。
【让记忆与速度不再矛盾】
在具身智能领域,“金鱼记忆”是困扰视觉-语言-动作模型的长期痛点。想要让 机器人 记住历史操作并实时决策,推理延迟就会急剧攀升,动作随即卡顿。
此次发布的视觉-语言-动作模型Manip正是为解决这一矛盾而生。它基于面壁智能多模态端侧大模型MiniCPM-V 4.6 训练,该系列模型累计下载量已突破2000万次,其独家的视觉词元极致压缩技术,为本次具身突破埋下了关键伏笔。
在 机器人 操作评测基准(RMBench)中,美国知名模型π0.5仅得到10分,Manip拿到53分,跻身第一梯队。Manip不仅可以连贯地“做三明治”,其单步决策延迟仅120毫秒。
【首个纯无网部署的追踪模型】
不依赖任何云端算力,此次发布的跟踪导航模型Track,仅靠机身原装摄像头和本地芯片,即可在拔掉网卡的状态下,听懂自然语言指令并持续追踪目标。这是业内首个支持真实本地、纯无网部署的追踪模型。
在未做下游强化学习优化的情况下,Track在真实场景评测中追踪率最高达89.8%,相比全域追踪视觉-语言-动作模型(OmTrackVLA)三项指标平均提升超9个百分点。
【园区巡检、工业仓储成为试验场】
目前,不少具身智能团队遵循“从点到面”的路线:先在特定场景中训练专用技能,再逐步扩展能力边界。面壁智能选择的是从通用模型出发,将视觉理解、语言指令、状态判断和动作输出放进统一框架,再落到具体任务。
随着 机器人 进入家庭、办公室和工厂,仅依靠云端难以同时满足实时响应、可靠运行和隐私保护。面壁智能多模态首席科学家、清华大学 人工智能 学院助理教授姚远认为,将感知、决策与执行部署在本地硬件设备上,既能保障及时响应,也能降低隐私风险。
据悉,面壁智能正与乐聚 机器人 、 吉利汽车 等合作,将展厅导览、园区巡检、工业仓储等场景作为端侧具身智能的试验场。
(文章来源:上观新闻)