京东开源实时流式视频编辑模型,京东AI又有突破了?
2026年08月06日 23:12:22
8月5日,京东宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit,用户可以一边观看视频,一边修改人物与场景,让视频创作从“先有素材再修改”变为可实时互动编辑。在流式实时视频编辑方向,JoyAI-Video-Edit对比当前业内代表性模型,各项指标全面领先,达到世界一流水平。
首先,视频内容的边际成本一直居高不下。传统的视频创作遵循“先拍摄后剪辑”的逻辑,这不仅时间周期长,而且修改成本极高。JoyAI-Video-Edit最大的亮点在于其“实时流式”特性。它不再受限于短片段的处理,而是能在720P分辨率下实现每秒30帧的推理速度。这意味着,视频创作从“一次性成品”变成了“可流动的过程”。对于直播带货、家装设计这类强交互场景来说,这种技术直接将试错成本降到了最低。以前为了换一个背景可能需要重新搭建直播间,现在只需要在流中实时修改,这实质上是重构了内容生产的生产函数。
其次,技术指标的领先并非孤立存在,而是构建了新的竞争壁垒。在OpenVE-Bench等权威评测中,该模型在风格迁移、局部替换等任务上超越了SANA Streaming等国际代表性模型。这种全面领先并非简单的参数堆砌,而是解决了“速度与质量”的悖论。在流式编辑中,既要保证不卡顿,又要保证画面不崩坏,这对算法的稳定性要求极高。京东能够做到兼顾速度与离线级别的画质,说明其在底层算力优化和模型架构设计上已经积累了相当深厚的“护城河”。这对于整个AIGC行业而言,提供了一个可参考的高标准范式。
第三,JoyAI-Video-Edit不仅是工具,更是具身智能数据合成的关键一环。机器人训练缺乏真实场景数据一直是行业难题,而该模型能将人手操作视频转化为机械臂训练素材,这在逻辑上打通了“虚拟生成”到“现实应用”的链路。结合其已有的JoyAI-Image-Edit、JoyAI-VL-Interaction、JoyAI-RA等模型,京东正在构建一个庞大的物理世界模型矩阵。这种从语音、图像到视频、机器人操控的全栈式布局,表明京东并不满足于做一个应用层的公司,而是试图在基础设施层面掌握未来由数字世界进入物理世界的主动权。
因此,京东开源这一模型,表面上是视频技术的突破,实则是其重塑物理世界交互能力的重要一步,这才是京东最值得我们关注的点。