论文

SpeechParaling-Bench:副语言感知语音生成的综合基准

SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation

模型评测基准与评测资源

摘要

副语言线索对于自然人机交互至关重要,但它们在大型音频语言模型(LALM)中的评估仍然受到粗略特征覆盖和评估固有主观性的限制。为了应对这些挑战,我们推出了 SpeechParaling-Bench,这是一个用于副语言感知语音生成的综合基准。它将现有的细粒度特征的覆盖范围从不到 50 个扩展到 100 多个,并由 1000 多个英汉并行语音查询支持,并被组织成三个逐渐具有挑战性的任务:细粒度控制、话语内变化和上下文感知适应。为了实现可靠的评估,我们进一步开发了一个成对比较管道,其中由基于 LALM 的法官根据固定基线评估候选响应。通过将评估框架为相对偏好而不是绝对评分,这种方法减轻了主观性,并产生更稳定和可扩展的评估,而无需昂贵的人工注释。大量实验揭示了当前 LALM 的巨大局限性。即使领先的专有模型也难以应对副语言特征的全面静态控制和动态调制,而未能正确解释副语言线索则占情景对话错误的 43.3%。这些发现强调需要针对人类语音助手建立更强大的副语言模型。