登录

ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事


速读:ECCV2026Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事2026年08月28日07:31机器之心Pro刘恺骐,北京大学博士生,主要研究方向为可控视频生成、音视频联合生成、世界模型、理解生成统一模型及多模态大模型等,相关成果发表于ECCV、ICCV、CVPR等国际会议。 过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。
2026年08月28日 07:3

刘恺骐,北京大学博士生,主要研究方向为可控视频生成、音视频联合生成、世界模型、理解生成统一模型及多模态大模型等,相关成果发表于 ECCV、ICCV、CVPR 等国际会议。

过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。

但当任务从「生成一个漂亮片段」,变成「完整拍完一场戏」,问题就不一样了。

前一个镜头里,女主说完一句话;画面随即切到男主,他停顿片刻后作出回应;接着镜头切回女主,而男主在画外继续说话。要完成这段内容,模型不仅需要知道画面中有什么,还要准确执行一系列叙事约束:何时切镜?谁在什么时候开口?对白能否与口型和动作对应?切镜之后,人物的脸和声音还能否保持一致?

即使这些要求已经写进脚本,现有模型仍可能出现切镜错位、对白提前或延后,以及多人场景中的串脸、串音。问题不只在于故事有没有说清楚,更在于模型内部是否具备沿着复杂时间线组织音视频内容的能力。

为此,北京大学、可灵团队、中国科学院自动化研究所和中山大学联合提出  MAVIN,一种支持定制化叙事控制的多镜头音视频联合生成模型 。

目前,该论文已被  ECCV 2026 以 Oral  形式接收。刘恺骐为第一作者,翁书晨、施柏鑫为通讯作者。

论文标题:  MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

作者单位:  北京大学、可灵团队、中国科学院自动化研究所、中山大学

论文地址: https://arxiv.org/abs/2606.29473

项目主页: https://liukqchoco.github.io/MAVIN/

一、会生成电影感画面,

为什么还「拍不完一场戏」?

多镜头音视频叙事至少面临三类挑战。

首先是时间错位。模型可能知道脚本中有哪些人物和事件,却无法判断它们应该出现在哪个时间段:镜头已经切换,上一名角色的声音仍在继续;人物尚未出现,对白却提前响起。

其次是身份混淆。同一名角色跨镜头出现时,不仅要保持面部、发型和服装一致,也要维持稳定的音色;多名人物交替对话时,还要避免串脸、串音和说话人绑定错误。

此外,用户通常只会输入一段故事梗概,很少完整标注镜头边界、对白区间、角色外貌和声音事件。系统既需要补全一份可执行的剧本,也需要真正按照这份剧本完成生成。

因此,MAVIN 要解决的并不是简单的「多生成几个镜头」,而是让模型学会在一条统一的叙事时间线上,调度画面、对白、动作和角色身份。

主题:模型|视频