音视频
分类
对话
在这篇文章中,我们把OmniVChat(OmniVideoChat)定义为原生的音视频对话:模型直接、同时接收用户音频和视频,无需额外的文本问题、外部字幕或语音识别转写,从而保留语气、停顿、表情和镜头朝向等线索。
文章
我们设计了OmniVChat-Studio,一个Multi-Agent的原生音视频对话数据引擎,输入是一份子类配置和文本语料(作为随机种子),输出是带参考回复和分层判分标准的单轮、多轮音视频对话。
文章
特别是多轮的原生音视频对话数据,包含AI在前轮中对用户的回应,几乎无法找到。
文章
由于数据的稀缺性,现有的Omni模型的原生音视频对话能力其实有待提高,往往需要各种辅助模块(比如语音转文字)来辅助交互,但是语音转文字等等辅助模块,往往会带来额外的计算量和信息损失,拉低了交互体验的上限。
文章
由此,我们构建了数据引擎OmniVChat-Studio、评测基准OmniVChat-Bench和强化学习奖励设计OmniVChat-RL,把原生音视频对话的造数据、测能力和改进模型接在一起。
文章
内容
现有的音视频交互的研究中,对“交互”的定义往往其实是对音视频内容的问答,比如对于一个流式视频,用户输入一个文本问题,然后模型选择合适的时机回答。
文章
音视频联合生成和Agent的进展,让我们认为「为了理解而生成」(generationforcomprehension)成为了可行的路线:先明确要测试的能力,再合成对应对话,并依据实际音视频内容形成参考回复和评分标准。
文章
交互