论文
OmniVChat:原生视听对话的综合、基准测试和训练
OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue
摘要
我们将 OmniVChat(Omni Video Chat)定义为用户和全向模型之间的本机视听对话的任务。在 OmniVChat 中,全向模型直接同时接收来自用户的音频和视频并返回文本。用户的查询嵌入在音频和视频中,无需单独的文本问题、外部字幕或语音识别。直接视听输入减少了外部延迟和计算,同时保留了感知线索。然而,OmniVChat 的研究面临两个限制:数据可用性和评估。人们使用自己的设备的录音很少。此外,一个好的回复通常需要考虑用户的周围环境、面部表情和附近的物体,而这样的回复可以用多种不同的方式表达,使得关键字匹配对于评估回复质量来说不可靠。代理系统和视频生成的最新进展使得理解生成变得可行,这意味着使用合成对话进行训练和评估。因此,我们提出了 OmniVChat-Studio,一个用于合成单轮和多轮视听对话的多代理数据引擎。我们使用合成对话来构建 OmniVChat-Bench,这是一个评估基准,用于评估全能模型跨五个能力类别的基本对话能力。我们还推出了 OmniVChat-RL,这是一种强化学习奖励设计,共同针对 OmniVChat 中的回复正确性、效率和风格。使用 OmniVChat-RL 在合成对话上训练 Qwen3-Omni-Instruct 可提高其在 OmniVChat-Bench 和人工录制的 OmniVChat-Bench-Human 上的性能。这些成果验证了奖励设计,并展示了在训练和评估中向现实世界对话的转移。