从广义机器人到物理AI,追觅寻找智能家庭场景入口
8月10日,《纽约客》撰稿人欧逸文在其文章中描述了一段中国人工智能之旅。
他在一张桌子旁,观察一对纤细的金属机械臂正在折叠一件蓝色T恤。这个看似不起眼的工程在科技圈有时被称为“机器人领域的圣杯”,因为这项任务既复杂又充满挑战,而且一旦成功,公众的热情也会很高。
而行业关注两个指标,机器人完成任务的速度以及失败率。失败源于随机性。“你可以用很多种方式把衣服放在桌子上,但每次折叠后的形状都不一样。”
这真实反映了一个现象,从工程角度看,家庭几乎是最不愿意配合机器人的环境。截至今天,大量的资金注入,人工智能还没有规模化进到家里,以至于来自图灵奖得主、纽约大学教授、Meta前首席AI科学家Yann LeCun直言:目前几乎没有公司知道如何让机器人真正聪明到实用。
但从行业来看,To C是物理AI进入真实世界的门票,而家庭是最重要的消费级市场之一。如何跨越实验室与真实世界这道巨大的鸿沟,将成为决定未来人工智能赛道格局的关键一步,而在这个漫长的征程中,以追觅为代表的拥有大量家庭真实场景的科技公司,或将为行业打头阵。
物理AI落地家庭的鸿沟
当你回到家,向机器人下达一句“把桌子收拾一下”的指令,对于终端来说,却要面临无数需要感知理解的场景。
哪些东西是垃圾,哪些东西不能动;杯子应该放进水槽还是洗碗机;孩子突然跑过来时是否需要停止;用户中途改变指令后,已经完成的步骤又该如何处理。这还只是在一个家庭中,面对不同家庭,物品摆放、生活习惯和成员偏好各不相同,甚至连“垃圾”的定义都不一致。
这不是简单的预设任务程序可以完成的,它需要机器人拥有世界理解、任务规划、动作执行、安全交互和异常处理的综合能力。同时,家庭成员的需求更加多元,家务操作只是其中一部分,运动健康、儿童成长、日常互动、安全管理和生活协助,同样构成长期存在的需求。
但从目前行业现状看,物理AI在家庭场景中落地还有很大的鸿沟,最大的技术障碍在于其在“非结构化开放世界”中的泛化能力不足。
与生产线、仓库等相对标准化的环境不同,家庭没有固定的场景。同一张桌子,今天放着水杯,明天可能堆着药品、玩具和水果;老人、儿童和宠物也会不断改变环境状态。机器人面对的不是预先布置好的实验空间,而是一个持续变化、充满意外的真实世界。
当人们对机器人说“把桌上那杯水递给我”,虽然这个任务很明确,但机器人得理解桌子和杯子分别是什么,以及杯子在三维空间中的确切位置,该用多大的力握持杯子,水满时移动要平稳,递到人手里时要等对方握住才能松手。这需要机器对物理世界的空间、力学、物理因果等规律有深刻的理解与执行能力。
更复杂的地方在于,当前不少机器人已经能够在训练数据中认出杯子,但真正的理解意味着,机器人既能从不同颜色、材质和形状的容器中归纳出杯子的共性,又能区分哪个杯子属于谁、哪个杯子装有热水、哪个杯子不适合抓取。它需要把视觉、语言、触觉、力觉与空间信息联系起来,形成对物体属性、相互关系和行为后果的统一认识。
然而,目前以语言为核心的基础模型更擅长处理符号和文本信息,并不天然适合精确编码三维空间、物理因果和连续动作。同时,数据不足进一步放大了这一难题。大语言模型可以利用海量互联网文本进行训练,而真实家庭中的触觉、力控和人机交互数据不仅稀缺,采集成本也很高。家庭环境中还存在光照变化、地面扰动、机械阻力和人员随机移动等大量变量,有限的预训练数据很难覆盖全部真实情况。即使机器人能够在实验室或样板间完成任务,也未必能够直接适应千家万户。
归根结底,想要家庭落地,物理AI还需要跨越世界理解、数据训练、算法泛化、精细控制、安全保障和隐私信任等多重鸿沟。
从需求出发,让机器人先落地
现实的困境阻挡不了物理AI走进家庭的趋势,当下行业显然无法实现一步到位的全能管家,但遵循单点突破的产业规律,企业可以在清洁、收纳、情感陪伴或教育等细分领域找到技术可行、用户刚需、商业能跑通的切口。
能够有机会打开市场的功能,通常需要满足三个条件:足够高频、足够令人厌烦,并且无法被现有工具轻易替代。
扫地机器人就是最经典的范本。地面清洁每日都要做,弯腰费力且枯燥乏味,又没有更轻便的替代方案,它只打透了家务海洋里的这一个细分水域,就撑起了一个千亿级的成熟产业。
同时,这个行业的底层技术与逻辑与具身智能是一致的,其本身就是广义机器人产品。追觅扫地机目前形成的高速数字马达、智能算法与仿生机械臂核心技术,可以完成对任务的“感知—决策—执行”闭环。
追觅扫地机已实现从四大类型识别扩展至280+物体种类识别,最小可识别3mm高度障碍物,对5mm以内低矮障碍物实现100%避障,通过VLM视觉语言大模型与端云协同方案,开放类别识别能力理论上不设上限,App端支持用户自定义添加50类物品识别。