VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应
图 1:RefCaptioner 的任务动机。普通视频描述只生成文本,难以表达候选参考图与局部视频语义之间的对应关系;RefCaptioner 从最多 22 张候选图中选出视频实际出现的内容,将图像标签放在对应短语之后,同时排除无关干扰项。
近年来,随着多模态大模型的发展,视频理解领域已经可以对视频的内容进行详尽的描述。 然而随着多参考图视频生成与编辑的发展,除了对视频本身的理解,通常还需要模型经常同时处理人物、服装、场景等多张参考图,建立参考图和视频的对应关系。而我们通过实验发现一个几乎所有多模态大模型都存在的问题: 模型虽然可以将简单的视 频主体和参考图主体对 应,但当参考图增多时,视频理解模型对于视频中的主体和参考图的对应能力则会大幅下降。
这正是现有视频描述范式的盲区。普通 Caption 只要求文本忠实于视频;多参考图场景还要求模型在候选图之间做选择,把每张有效参考图落到正确的局部短语上,并理解同一个主体多张不同视角,姿态的图片可能属于同一主体。问题因此从 “生成一段好的描述”,变成 “在生成描述的同时建立可用的视频对象 - 参考图对应关系”。
这引出了一个核心问题:当输入是视频和大量参考图时,如何更好的建立视频语义和参考图之间的关系,并给出合理且正确的视频理解内容?
对于这个问题,我们将多参考图场景下的视频 caption 问题进行梳理。首先。多参考图里可能有真正出现的主体和场景,也可能混入外观相似的干扰项,现有的 VLM 要么过于自信全部引用,要么过度保守又会漏掉有效信息。其次,很多 VLM 在识别参考图片时,对于同一个人或物体可能由多张不同视角图片,模型也会识别成不同的人或者物体,然而这种情况,模型需要把这些图片归到同一实体,而不是拆成多个对象。
对于这个问题,我们提出了 RefCaptioner ,通过后训练强化模型对参考图的识别和感应能力,同时,我们对输出的 caption 进行结构化构建,从场景,人物,物体,动作,外貌,运镜等建立结构化 caption 格式,并通过 SFT 强化输出格式约束,提升不同参考图与不同种视频语义的对应能力。同时我们建立了双层自适应奖励函数 HCD-GRPO,在保持细粒度视频语义的同时,优化模型对干扰图的识别和同一主体不同风格参考图的识别能力。
团队核心成员包括北京大学博士生刘腾飞、史阳以及可灵团队多模态理解负责人张远行。