论文

VideoFDB:评估会话代理的全双工视觉语音功能

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

模型评测基准与评测资源

摘要

自然的人类对话是全双工和视听的:人们同时说话和听,同时不断解释和产生非语言提示,例如点头、微笑和手势。为了支持成功的人机交互,代理必须对全双工视听对话进行建模;然而,现有的全双工基准仅评估语音。在这项工作中,我们提出了 VideoFDB,这是第一个评估全双工视听到视听 (AV2AV) 对话代理的基准。 VideoFDB 贡献了 (i) 237 个二元剪辑,涵盖来自现实世界视频通话的 11 个非语言对话动态,(ii) 将感知与生成行为分开的分类法,以及 (iii) 基于标题的 LM 作为法官评估框架,具有可解释的轴,用于评估非语言对话动态的对话质量。在开源和闭源视觉语音代理中,我们发现了系统性故障模式:字幕崩溃和视觉流无知,并且我们表明,当前系统利用视觉来进行明确的视觉问答,但不能用于自然对话中所需的流联合视听基础。我们进一步评估了级联语音到化身系统,发现它们的架构从根本上排除了全双工非语言线索的产生。作为全双工 AV2AV 交互的第一个基准,VideoFDB 为系统评估奠定了基础,我们希望它将加速下一代多模式会话代理的进步和发展。