登录

参考图


分类

识别

RefCaptioner,通过后训练强化模型对参考图的识别和感应能力,同时,我们对输出的caption进行结构化构建,从场景,人物,物体,动作,外貌,运镜等建立结构化caption格式,并通过SFT强化输出格式约束,提升不同参考图与不同种视频语义的对应能力。
文章

同时我们建立了双层自适应奖励函数HCD-GRPO,在保持细粒度视频语义的同时,优化模型对干扰图的识别和同一主体不同风格参考图的识别能力。
文章

对应关系

问题因此从“生成一段好的描述”,变成“在生成描述的同时建立可用的视频对象-参考图对应关系”。
文章

场景

参考图场景还要求模型在候选图之间做选择,把每张有效参考图落到正确的局部短语上,并理解同一个主体多张不同视角,姿态的图片可能属于同一主体。
文章

对于这个问题,我们将多参考图场景下的视频caption问题进行梳理。
文章

之间

这引出了一个核心问题:当输入是视频和大量参考图时,如何更好的建立视频语义和参考图之间的关系,并给出合理且正确的视频理解内容?
文章

主体

而我们通过实验发现一个几乎所有多模态大模型都存在的问题:模型虽然可以将简单的视频主体和参考图主体对应,但当参考图增多时,视频理解模型对于视频中的主体和参考图的对应能力则会大幅下降。
文章