登录

京东开源自研JoyAI-Video-Edit模型,字节、MiniMax争相亮剑,视频模型“暗战”正酣


速读:京东开源自研JoyAI-Video-Edit模型,字节、MiniMax争相亮剑,视频模型“暗战”正酣京东开源自研JoyAI-Video-Edit模型,字节、MiniMax争相亮剑,视频模型“暗战”正酣_东方财富网。 随着视频创作告别“先拍完再剪辑”的线性流程,视频模型“暗战”也来到高潮。 而在此前的7月31日,MiniMax发布新一代多模态生成模型H3,支持文本、图片、音频和视频等多种输入形式,支持2K分辨率直出,可生成最长15秒的音画内容; 技术路径上,记者还了解到,JoyAI-Video-Edit是一个160亿参数的自回归扩散框架,由多模态大语言模型条件编码器和多模态扩散Transformer(Transformer模型架构是一种深度学习模型)组成。 据记者了解,这种战略布局也体现在京东的模型矩阵中。
京东开源自研JoyAI-Video-Edit模型,字节、MiniMax争相亮剑,视频模型“暗战”正酣 _ 东方财富网

京东开源自研JoyAI-Video-Edit模型,字节、MiniMax争相亮剑,视频模型“暗战”正酣

2026年08月05日 21:26

  随着视频创作告别“先拍完再剪辑”的线性流程,视频模型“暗战”也来到高潮。

  8月5日, 京东 宣布,开源自研的实时流式视频编辑模型——JoyAI-Video-Edit,用户在观看视频的同时,可实时修改人物形象、替换场景、调整画面风格。这相当于给视频装上了一块“实时编辑 面板 ”,过去需要等待整段渲染才能看到效果的操作,如今在播放过程中就能完成。

  同日,字节跳动(以下简称字节)也亮出“新武器”,正式推出原生音视频全双工大模型——SeedRealtime,采用统一架构原生融合音频、视频与文本,在连续的多模态信息流上实现实时交互,主打“边看、边听、边说”。

  而在此前的7月31日,MiniMax发布新一代多模态生成模型H3,支持文本、图片、音频和视频等多种输入形式,支持2K分辨率直出,可生成最长15秒的音画内容;字节也在同一天迭代Seedance 2.5,可单次生成30秒视频片段。快手可灵、阿里通义万相、腾讯混元视频等模型近来也动作频频。

  视频创作告别“抽卡”?

  通常来说,视频由一帧帧连续画面构成。传统视频生成模型处理的是“离线任务”,换言之,就是用户输入指令,模型花几十秒甚至几分钟生成一段视频,才能看到结果。如果对某个细节不满意,只能重新输入指令、重新等待。生成式 人工智能 中输出结果的随机性采样过程,被称为“抽卡”。

  记者注意到,JoyAI-Video-Edit试图打破这个流程,该模型支持任意时长的稳定流式编辑,即视频可以持续播放,模型可以持续处理,不必等待整段生成完成。这意味着视频创作从“一次性抽卡”变成了“可微调的橡皮泥”。

  比如,服装展示视频可以实时更换人物穿搭和背景,家装设计可以一边播放一边切换家具、墙面和灯光效果。影视创作者则可以更快尝试不同的人物造型、场景和视觉效果,减少重复拍摄与整段返工。

  技术路径上,记者还了解到,JoyAI-Video-Edit是一个160亿参数的自回归扩散框架,由多模态大语言模型条件编码器和多模态扩散Transformer(Transformer模型架构是一种深度学习模型)组成。不过,实时流式编辑的技术难点并不只在“快”。

  此前, 京东 探索研究院副院长段楠在接受记者采访时指出,视频生成模型不仅是AI视觉内容的生产工具,更是对物理世界的模拟和数据合成的模型。

  视频编辑能力不只是内容生产工具,而是通往“物理AI”的基础设施。这或许也是 京东 开源的战略意图所在。

  段楠还将京东的AI战略划分为三个递进阶段:数字智能,基于互联网数据构建语言、代码、多模态理解生成模型;附身智能,将AI能力赋能到电脑、手机、可穿戴设备、智能座舱等设备,强调实时多模态交互;具身智能,将模型扩展到 机器人 等硬件,让机器能够感知物理空间、建模物理规律、在真实环境中执行操作。

  JoyAI-Video-Edit处于第二和第三阶段的交叉点上。段楠告诉记者,流式视频编辑模型不仅是视频生成领域一个重要的方向,也会对附身智能视频实时交互的需求以及具身智能中数据合成的需求,提供非常基础的能力。

  据记者了解,这种战略布局也体现在京东的模型矩阵中。今年上半年,京东还发布了图像空间编辑模型JoyAI-Image-Edit、多模态实时交互模型JoyAI-VL-Interaction、长视频生成模型JoyAI-Echo,以及强调高情商表达的实时语音交互模型JoyAI-Talker。

  段楠还透露,2026年下半年,京东将在多模态理解和视频世界模型两个方向推出旗舰模型。

  视频模型价值评判标准被重写

  如果把视线拉回整个行业,京东的模型矩阵布局以及新模型的开源,只是今年视频模型竞逐的一个切片。2026年上半年,视频生成模型比拼的主旋律是“时长竞赛”。字节Seedance 2.5将单段视频从15秒拉到30秒;MiniMax H3支持最长15秒的音画内容;快手可灵、阿里通义万相也在此迭代。

  如今,战局与各家的战略意图明显分化。视频生成模型的竞争维度,正在从“生成能力”转向“控制能力”。

  从“能不能生成一段好看的视频”到“生成出来的东西能不能被持续修改、实时控制、灵活复用”。从一次性输出到可交互编辑,从离线生成到流式处理。这也是视频模型从“玩具”走向“工具”的必经之路。

  对此,段楠在接受记者采访时有一个概括性的判断:进入2026年,出现了两个显著的变化趋势,一是各家在关注模型智力水平的基础之上,更关心模型能不能真正干活,以及如何把基础模型落地到日常工作流或生活场景中;二是具身智能和物理AI的关注度急剧上升,视频模型不再仅仅是内容创作工具,更被赋予了“对物理世界建模”和“为数据合成提供能力”的期待。

  视频模型的价值评判标准正在被重写。“能生成”只是入场券,“能被控制”才是核心竞争力。在这个市场风向中,谁更占据优势?

  日前,IDC中国研究总监卢言霞在接受记者邮件采访时表示,“我想在这个领域,应该还是互联网公司的优势会更大,决胜因素是算力、数据和人才。具备这三要素的更多还是互联网公司。所以中短期的话,可能还是字节、快手等” 。

  而随着视频模型“工具性”转变的一面逐渐显露在牌桌上,这场竞争或许也越来越接近各个玩家亮底牌的时刻了。

(文章来源:每日经济新闻)

主题:字节|视频模型|基金|新股|美股