论文
RoleBreak:口语对话中长期角色扮演稳健性的基准测试
RoleBreak: Benchmarking Long-Horizon Role-Playing Robustness in Spoken Dialogue
摘要
语音对语音对话模型越来越支持角色控制,但现有的口语角色扮演基准仍然主要以角色为中心且视野较短。这使得口语对话模型是否能够在扩展的交互中维持不同的角色,特别是超出预定义的虚构角色。我们推出 RoleBreak,这是一个针对口语对话中长期角色扮演稳健性的开放基准。 RoleBreak包含310个基于角色和以用户为中心的角色,6,688个经过人工验证的对话回合,以及11,743个细粒度的评估标准,其中1,856个回合带有用于评估声音情感的表达情感目标。其场景旨在强调角色一致性、交互质量、安全性以及长时间对话的影响力。我们评估了涵盖全双工、全模式和级联 ASR--LLM--TTS 范式的九种配置。我们发现了四种关键模式。首先,当前的系统在语义角色依从性方面比在声音情感方面要强得多。其次,语义鲁棒性在长时间交互中仍然很脆弱:即使是最强大的评估系统,平均仅在 10.4 和 11.6 轮后就会遇到第一个角色和安全故障。第三,扩大大语言模型的规模可以大大提高语义鲁棒性并延迟失败,但对声音情感的改善却很小。最后,即使语言内容是固定的,用户的声音情感也会影响角色扮演行为。这些发现凸显了口语角色扮演系统中长期稳健性和声音表达力方面持续存在的差距。