参考图
分类
识别
RefCaptioner,通过后训练强化模型对参考图的识别和感应能力,同时,我们对输出的caption进行结构化构建,从场景,人物,物体,动作,外貌,运镜等建立结构化caption格式,并通过SFT强化输出格式约束,提升不同参考图与不同种视频语义的对应能力。
文章
同时我们建立了双层自适应奖励函数HCD-GRPO,在保持细粒度视频语义的同时,优化模型对干扰图的识别和同一主体不同风格参考图的识别能力。
文章
对应关系
问题因此从“生成一段好的描述”,变成“在生成描述的同时建立可用的视频对象-参考图对应关系”。
文章
场景
多参考图场景还要求模型在候选图之间做选择,把每张有效参考图落到正确的局部短语上,并理解同一个主体多张不同视角,姿态的图片可能属于同一主体。
文章
对于这个问题,我们将多参考图场景下的视频caption问题进行梳理。
文章
之间
这引出了一个核心问题:当输入是视频和大量参考图时,如何更好的建立视频语义和参考图之间的关系,并给出合理且正确的视频理解内容?
文章
主体
而我们通过实验发现一个几乎所有多模态大模型都存在的问题:模型虽然可以将简单的视频主体和参考图主体对应,但当参考图增多时,视频理解模型对于视频中的主体和参考图的对应能力则会大幅下降。
文章