登录

MoWorld-3 D世界模型发布,打通AI从“对话交互”到“物理交互”的关键一步


速读:7月16日,WAIC开幕前夕,国家人工智能应用中试基地(具身智能)联合华为、魔芯(杭州)科技有限公司于杭州正式发布MoWorld-3D世界模型,全栈基于N腾NPU构建的交互式三维世界模型正式亮相。
2026-08-06 20:14:23 来源:新华网

在不久前落幕的2026世界人工智能大会(WAIC)期间,“世界模型”成为场内外热议的高频词。目前,大多数视频生成模型仍在比拼影视创作能力,而业界前沿目光已转向一个更具挑战性的命题,为视频模型引入物理可交互信号,让用户以物理输入的形式与模型进行交互。有业界认为,世界与视频的关键区别就在于世界是可实时物理交互的,因此一个可物理交互的视频模型等价于创造了一个世界,也就是世界模型。

世界模型应用非常广泛,它走向产业风口的真正原因,是源于近两年的大量的现实需求。产业界意识到,要让AI进入工厂车间、驶入城市道路、走进家庭场景,仅靠语言能力远远不够,必须掌握重力、碰撞、摩擦乃至因果关系等物理世界的基本法则。而在现实环境中反复试错成本高昂、风险不可控,世界模型提供的虚拟仿真场,将训练试错转移至算力集群,大幅降低落地门槛。此外,世界模型在游戏娱乐、影视内容创作、工业测绘等领域都展现了巨大的应用潜力。

业界普遍认为,2026年是“世界模型元年”。在此背景下,国产世界模型的突破显得尤为关键。

7月16日,WAIC开幕前夕,国家人工智能应用中试基地(具身智能)联合华为、魔芯(杭州)科技有限公司于杭州正式发布MoWorld-3D世界模型,全栈基于N腾NPU构建的交互式三维世界模型正式亮相。MoWorld-3D将走出实验室,成为即插即用的公共工具,向全行业开放能力,支撑各领域空间智能应用快速落地。

MoWorld-3D的核心能力很直观,用户可通过图像、文本等输入方式生成具备空间结构的三维场景,实现一套完整的、符合现实物理逻辑的高清3D场景。MoWorld-3D采用相机的六自由度运动作为物理信号,用户可在其生成的“世界”里行走、转身、环绕观测场景全貌。并且所产生的世界中建筑结构、道路走向、物体位置均贴合真实空间规律。

此次MoWorld-3D正式发布,也是魔芯科技技术路线的重要里程碑。成立于2021年的魔芯科技,长期深耕4D动态世界基座大模型研发,以全国产算力为底座,主攻空间智能核心技术,产品覆盖自动驾驶、工业数字孪生、影视3D内容、具身智能等多个赛道。早在2025年12月,魔芯科技便落地华为(杭州)培训中心,推出交互式视频世界模型KOKONI-World原型,完成技术可行性验证。2026年7月,魔芯科技再次推出全国产自研世界模型基座MoWorld。这次,基于MoWorld强大的场景生成能力作为基础,MoWorld-3D实现了架构、性能、工程化能力全面升级,实现从实验室原型到规模化落地的完整跨越。

技术参数层面,MoWorld-3D采用28B参数MoE混合专家架构,依托N腾NPU集群稳定运行,推理综合成本仅为同等规模进口GPU方案的30%。低成本、高实时性的双重优势,为具身智能规模化训练打开了全新路径。

超高实时交互性能与成本优势,源自魔芯科技与N腾AI长达一年多的深度联合创新。不同于普通视频模型,世界模型对长序列训练、多卡并行调度、推理时延、集群稳定性提出严苛要求,单纯硬件适配无法释放全部性能。N腾不仅提供稳定可靠的自主创新算力底座,更开放底层算子、并行调度工具链。双方团队围绕N腾AI基础软硬件开展系统性技术攻关,完成多NPU协同调度优化、注意力计算轻量化、混合精度量化、生成算子融合等多层改造,将场景解码、主干生成任务拆分至多卡并行执行,减少显存冗余搬运与无效计算,最终实现高速低成本的“世界”生成。

对于人形机器人、自动驾驶等产业而言,MoWorld-3D的落地具有重要意义。过去,工业机器人、服务机器人掌握抓取、避障、搬运等动作,需要在真实产线、居家环境中成百上千次实操试错,设备损耗、场地、时间成本居高不下,还存在碰撞伤人、设备损毁的安全隐患。依托MoWorld-3D搭建的数字仿真训练场,机器人所有动作演练均可在虚拟空间完成,碰撞、失误仅产生虚拟损耗,支持高频次复盘迭代。

当全球AI产业正在加速从会聊天的语言智能向能行动、懂物理的空间智能跃迁,MoWorld-3D依托N腾算力实现全栈自研突破,不仅为具身智能、自动驾驶、数字孪生等行业发展提供了自主可控的数字底座,更为空间智能产业自主化发展探明了可行路径。

主题:世界模型|MoWorld-3D