登录

国产世界模型EchoWM开源!会发声的「可探索世界」来了


速读:进入到2026年,可交互世界生成面对一道更难的考题:AI生成的世界能否经得起用户反复探索? 会发声的「可探索世界」来了2026年09月10日09:31机器之心Pro编辑|杜伟。 同时发布并开源面向可交互视听世界生成的JoyAI-EchoWM。 的路线特点,兼顾跨视角控制与持续视听体验,为可进入的生成内容提供了更完整的能力组合。 该模型延续了此前JoyAI-Echo的原生音视频生成能力,在同一套框架中可以生成视频以及环境音、音乐和语音,同时能够实时响应用户操作。
2026年09月10日 09:3

编辑|杜伟

进入到 2026 年,可交互世界生成面对一道更难的考题: AI 生成的世界能否经得起用户反复探索 ?一扇门画得逼真,只是起点。往前走,它要自然靠近;穿过走廊再回头,它还应该留在原来的位置。用户每一次移动、转身和折返,都在检验模型是否有能力记住已经生成的世界。

世界模型的竞争开始从画面质量延伸到持续交互中的可靠性。镜头要听从指令,场景要保持连贯,生成速度还要跟得上操作。这些能力需要同时成立,任何一处掉链子,都可能打断探索。

近一年来的技术进展,让这条主线更加清晰。谷歌 DeepMind 的 Genie 3 展示了实时探索与分钟级一致性,英伟达 SANA-WM 将分钟级生成、精确相机控制与更高效率结合了起来,World Labs 的 Atlas 通过空间上下文支持沿指定相机轨迹生成新视角,维持场景的几何关系。

当探索进一步触及到视听体验,新的问题随之出现:用户改变路线或者切换视角时,脚步声、环境声和人物说话声,是否能够与画面一起连贯地延续?因此,对于面向沉浸式内容的世界模型,视听生成与交互控制的结合更加值得关注。

9 月 9 日,在京东全球科技探索者大会(JDD)上,京东探索研究院发布 JoyAI-Echo 系列最新进展:超长音视频生成模型升级至 JoyAI-Echo 1.5; 同时发布并开源面向可交互视听世界生成的 JoyAI-EchoWM 。

该模型延续了此前 JoyAI-Echo 的原生音视频生成能力,在同一套框架中可以生成视频以及环境音、音乐和语音,同时能够实时响应用户操作。

现在,第一人称视角下,用户可以直接在场景中移动和探索;切换到第三人称视角,摄像机运动与主体运动也能保持协同。经过多轮、长时操作之后,整体画面、空间关系、主体状态依然能够很好地延续。 JoyAI-EchoWM  创造了一个真正可进入、可操控、可探索的视听一体化世界 。

在相关论文报告的 158 个 WBench Navigation 案例评测中, JoyAI-EchoWM  取得了 81.7 的最高平均分,并在一致性(89.8)和交互性(87.2)等指标上位于前列。同时四步因果流式版本 EchoWM-Flash 的平均分为 81.0,交互得分为 87.9,表明减少采样步数后,模型仍具备较强的导航响应能力。

相较于同一评测中的其他模型,Genie 3 强调实时探索与分钟级世界一致性;LingBot-World 2.0 通过因果生成与少步蒸馏推进长时程交互,并结合相机位姿和文本指令控制视角、动作及事件;HappyOyster 将音视频联合生成与实时交互结合,提供导演和第一人称漫游两种模式。 JoyAI-EchoWM  的路线特点,兼顾跨视角控制与持续视听体验,为可进入的生成内容提供了更完整的能力组合 。

这条技术路线如何体现在交互中,可以从用户按下操作键后,镜头、画面与声音的变化看起。

按下操作键,

AI 世界用画面与声音回应你

普通视频生成,生成结束以后任务基本完成。即使主体位置略有漂移、空间关系偶尔变化,只要整体画面自然,人眼未必能察觉到。可一旦允许用户自由移动、切换视角,此前很多可以被视觉效果遮过去的小错误,在交互状态下都可能会变成 Bug。

这是因为,交互给视频生成增加了一层要求:模型需要根据用户操作,生成与此前内容衔接的画面。

JoyAI-EchoWM 如何解决这些问题呢?它的思路是通过共用一套交互接口,让画面中的主体、空间关系和声音随着用户探索一起延续。团队将这一支持持续导航并获得同步视听反馈的模型称为面向「可进入生成媒体」的全模态世界模型。

arXiv 论文:https://arxiv.org/pdf/2608.23189

项目主页:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/

GitHub 代码:https://github.com/jd-opensource/JoyAI-Echo

要实现这样的交互,首先需要统一不同视角下的控制方式。第一人称视角下,镜头接近观察者的眼睛,移动镜头对应自身移动。第三人称多了一层关系:镜头要跟随人物、车辆等主体,主体运动也要与画面构图配合。与此同时,用户按下的 WASD 方向键是离散指令,模型需要处理的相机位置和朝向却是连续变化的,为不同视角和控制设备分别设计接口会增加系统的适配负担。

为此, JoyAI-EchoWM  采用了统一的 「相机意图」(camera intent) 表示,用以描述用户希望镜头如何移动、 从什么角度观察场景。键盘操作经过固定映射,转换为相对初始位姿的连续 6-DoF 轨迹,也就是镜头在 3D 空间中的平移和旋转。

同一条轨迹在不同视角下承担不同作用。第一人称下,它直接描述观察者的运动;第三人称下,它规定相机的变化,人物移动与镜头跟随之间的关系则由模型从数据中学习。模型无需额外接收角色轨迹、控制器状态或相机预设的跟随参数。

第一人称控制方式覆盖了户外、室内、水下和奇幻等多场景。用户可以沿着指定方向移动,让眼前环境逐步展开。 如下冰湖探索的演示中,第一人称视角沿冰面不断向前推进,远处的木门逐渐靠近,雪山、森林与湖面倒影持续展开,环境声也随画面同步生成。

第三人称视角展示了镜头与主体的配合。下面荒漠骑马的片段中,骑手向前推进,镜头从后方跟随,并左右移动。

探索过程中,声音同样参与生成。 JoyAI-EchoWM  采用 原生音视频联合生成 ,视频和音频分支在生成过程中交换信息,使声音与画面中的场景和事件相互关联。相机轨迹只直接输入视频分支,音频侧没有独立的轨迹条件,也没有额外训练一套「动作 — 声音控制器」。

简单来说,操作先改变画面,声音则根据画面的变化同步跟上。人物等主体讲话时生成对应语音,风、脚步和碰撞等事件伴随相应声响,音乐也随着场景延续。下面橘猫讲话的同时配上了背景音。

当探索进入下一轮,模型还要承接已经发生的内容。 JoyAI-EchoWM  会提取上一段末尾的一段同步音视频,作为下一轮生成的上下文 。用户在新一轮调整相机轨迹,继续向前探索。后续画面和声音共享同一段近期历史,为场景布局、主体外观和声音的延续提供依据。

这套机制有助于维持连续体验,但仍存在边界。模型目前没有显式的持久三维记忆,多轮生成后,几何关系、主体身份和音频仍可能发生漂移。

要让画面、声音和用户操作在同一个生成过程中形成配合,需要先解决数据与训练上的几道难题。

JoyAI-EchoWM  三重挑战:

好看、好控,长时间不跑偏

高质量音视频未必带有准确的相机轨迹,而轨迹可靠的数据也未必拥有丰富的声音。进入持续交互后,模型还要应对误差累积和不断增长的计算开销。 JoyAI-EchoWM  从数据引擎入手,通过统一轨迹尺度和分阶段训练,逐步连接起这些能力 。

首先是数据。团队采用了四类互补来源,搭建起了一套 世界数据引擎 ,不同数据分别提供更可靠的监督。其中:

内部采集的 gameplay 可以同步获得操作日志、原生游戏音频和较清晰的动作 — 观察对应关系;

互联网上的人类实玩录像,操作节奏更自然,也包含游戏对白、玩家解说等更丰富的人声;

UE(Unreal Engine)仿真直接提供米制真值位姿和动作日志,几何监督最干净,但不提供自然音频;

普通互联网视频补充真实世界外观、环境声、语音,以及更丰富的镜头和主体关系。

收集数据之后,团队又根据训练目标重新组织了三组数据配比。AV-rich 侧重画面、环境声和语音质量,Control-clean 优先保留轨迹可靠、运动清晰的样本,Balanced high-quality 则从中筛选兼具可靠控制信号和较高视听质量的数据,供后续联合训练使用。

主题:生成|世界|探索|模型|JoyAI-EchoWM|世界模型|一致性