论文

DuplexAct-Bench:扩展全双工语音评测,覆盖主动交互及多样行为要求

DuplexAct-Bench: Broadening Full-Duplex Speech Evaluation toward Proactive Interaction across Diverse Behavioral Requirements

模型评测基准与评测资源

摘要

现有全双工语音基准仅覆盖实时交互行为的一部分,而且上下文条件通常有限。我们提出DuplexAct-Bench,一个双语基准,在会话前、会话中和无显式要求三类条件下,系统覆盖六种互补行为,从打断和让出话轮,到主动发起、主动保持沉默及反馈性应答。我们通过1,290次英语和中文流式试验,从时机与内容两个维度评测12个全双工语音系统。结果揭示不同行为、条件和系统之间存在显著差异,语义质量与行为时机也经常不匹配。这些发现表明,随着实时交互展开,当前系统距离稳健地决定何时参与、是否参与及如何参与仍有较大差距。项目主页:https://alitaxky.icu/DuplexAct-Bench/