登录

千寻智能最强大脑亮相WAIC:攻克「金鱼记忆」,终结单一任务Demo内卷


速读:Moz1随即停下原来的动作,重新感知并判断环境变化,调整任务顺序和行动路线,转而拿起新增的纸团,将其扔进垃圾桶。 场景发生变化时,它还需要重新评估状态,调整任务顺序和行动方案,而不是记住固定坐标、路线或脚本。 家具布局、物品种类和摆放位置随时可能变化,目标物体可能被遮挡,也可能出现训练中未见过的新物品,人的走动和临时放入的杂物还会持续改变环境状态。 这类任务上下文和状态丢失的问题,常被形象地称为「金鱼记忆」。 把几个机器人动作按顺序连接起来,并不等于机器人具备了长程任务能力。
2026年07月17日 18:0

编辑|+0

持续火热的机器人,再次成为 WAIC 最抢镜的主角。

跳舞、搭积木、分拣物品……展台前,观众举着手机,哪里动作幅度大,镜头就往哪里追。

千寻智能的展台上,则来了两位画风完全不同的主角:一位是通体黑灰、看起来不苟言笑的 Moz1,埋头干活;另一位是首次公开亮相的 Moz2,奶杏色机身配上粉色小围脖「OOTD」,忙着向观众打招呼、举手比心,靠卖萌吸引了不少镜头。

镜头拉远,两个机器人所处的现场,有一块居家日常的客厅空间。沙发、餐桌、冰箱和洗碗机分布在不同位置,可乐、脏碗和玩偶散落其间,一眼看过去,像极了普通打工人的居家日常。

「快帮我整理客厅!」工作人员向机器人 Moz1 下达指令后,便退到一旁。接下来,是机器人的「表演」时刻:Moz1 先观察环境,再开始自主移动——它走到桌边拿起可乐,将其放进冰箱,随后又把餐桌上的脏碗送入洗碗机。

完成桌面清理后,Moz1 正准备转身前往沙发整理玩偶,一个纸团却意外被丢到了桌面上。Moz1 随即停下原来的动作,重新感知并判断环境变化,调整任务顺序和行动路线,转而拿起新增的纸团,将其扔进垃圾桶。处理完这一临时插入的任务后,Moz1 没有从头开始,而是继续执行尚未完成的玩偶收纳任务,将沙发附近的玩偶归入收纳筐。

没有人跟在后面提醒它「先拿这个」,也没有人在中途补充「下一步去那里」。从理解指令、拆解任务,到应对新增物体、局部调整计划,再到继续原来的任务,几项子任务被连续完成。

现场屏幕还会同步呈现任务拆解、当前步骤及后续计划,让观众看到一句自然语言指令如何被转化为一段持续执行的动作过程。

家务这种事,果然还是看别人做更轻松。不过,「整理客厅」这件看似普通的小事,对机器人来说,其实远没有看上去那么简单。

整理客厅为什么比看上去更难

人类听到「把客厅整理一下」,会自动补全许多没有被说出口的信息:哪些东西算乱、应该放到哪里、先收拾桌面还是先捡地上的物品。这个过程依赖长期积累的生活常识与经验,而机器人并不天然具备这些能力。

这类任务不同于抓取、分拣等边界清晰的机器人演示。后者通常预先定义了任务起点、结束条件、物品位置和操作流程;真实客厅却不是标准化工位。家具布局、物品种类和摆放位置随时可能变化,目标物体可能被遮挡,也可能出现训练中未见过的新物品,人的走动和临时放入的杂物还会持续改变环境状态。这种开放、动态且缺少统一规则的场景,构成了典型的非结构化环境。

因此,「整理客厅」考验的不只是机器人能否完成抓取、移动和放置,而是能否理解一个模糊目标,并将其转化为可执行的任务链:识别物品、判断类别、确定归位位置、规划路径、完成操作,并在每一步后确认结果。场景发生变化时,它还需要重新评估状态,调整任务顺序和行动方案,而不是记住固定坐标、路线或脚本。

这里涉及两项相互关联的能力:长程执行与场景泛化。 前者要求机器人沿着较长的任务链持续推进,记住总体目标、已完成步骤和待处理事项;后者要求它在布局变化、陌生物品、遮挡、路径受阻和临时干扰下,仍能将既有技能迁移到当前场景。

具身智能早期的许多演示,更擅长完成拿起杯子、打开抽屉等单点任务。但当动作链变长、子任务之间产生依赖后,问题就不再只是会不会抓,还包括是否记得为什么要抓,以及抓完之后做什么。机器人可能遗忘目标、漏掉步骤、重复处理已完成的物品,或因一次局部失败偏离后续计划。这类任务上下文和状态丢失的问题,常被形象地称为「金鱼记忆」。

长程任务还会放大局部误差。假设每个子步骤的成功率为 95%,且各步骤近似独立,那么包含 10 个连续步骤的任务,全部一次成功的概率只有约 60%。动作链越长,识别偏差、抓取失败和放置误差越容易累积;环境越开放,机器人需要处理的异常状态和分支情况也越多。

因此,长程能力不能只看单个动作做得是否准确;评价泛化能力,也不能只看机器人能否在另一套布置中复现相同流程。更关键的是, 它能否发现失败或环境变化,判断问题出现在哪一步,并通过局部修正或重新规划,继续完成原来的总体目标。

开冰箱、抓餐具,或者把玩偶放进收纳筐,这些动作并不新鲜。此次演示的变化在于,机器人需要围绕「整理客厅」这一整体目标,自主识别当前状态、决定下一步行动,并在环境变化中持续执行,而不是依赖人工逐步提示或预设脚本。

任务也由桌面上的单次抓取扩展到跨越不同家具和功能区域的连续操作,即从物体级走向空间级。机器人不仅要处理更多动作,还要协调导航与操作。例如,从桌边拿起饮料后移动到冰箱前,即使原来的桌面已经离开视野,它仍需掌握自己正在处理什么、物品是否抓稳、冰箱门处于什么状态,以及还有哪些物品尚未归位。

这要求机器人 持续维护一份动态更新的任务状态与场景表征 ,包括总体目标、已完成和待完成的子任务、物品及其空间关系、环境变化、执行异常和下一步行动。只有同时保持任务上下文,并动态理解非结构化环境,机器人才能从完成一次演示,走向在不同场景中完成同类任务。

长程任务背后,

Spirit v1.6 不只是把动作串起来

把几个机器人动作按顺序连接起来,并不等于机器人具备了长程任务能力。

如果饮料永远位于同一个位置,冰箱门永远保持相同角度,路径中也不会出现任何障碍,一段固定程序当然可以让机器人依次完成抓取、移动和放置,但真实环境不会严格配合程序。

物体可能被移动,目标位置可能被遮挡,某一步可能没有真正完成,机器人抓住的东西也可能在途中滑落。固定脚本只知道下一条指令是什么,却不知道环境是否仍然满足执行这条指令的条件,更不知道是否应该暂时放弃原计划、重新安排顺序。

针对这些问题, Spirit v1.6 采用了 VLA 与世界模型一体化架构 。VLA 负责将用户提出的语言目标、机器人看到的环境和机器人能够执行的动作连接起来;世界模型则用于理解物体之间的关系,并预判一个动作执行后,环境可能发生怎样的变化。

主题:任务|机器人|Moz1|物品|是机器人