论文
听听谁说了什么:通过反事实语音基础解锁说话者归因的推理
HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding
摘要
语音语言模型 (SLM) 越来越多地部署在多说话人环境中,但它们将语音归因于正确说话人以及对说话人身份进行推理的能力仍不清楚。因此,我们引入了 HEAR,这是一个概念上分层的基准测试,用于诊断说话者归因推理的基本能力,包含来自 887 个不同多方音频剪辑的 2.4K 个经过人工验证的样本。在 HEAR 上评估 20 个领先的 SLM 表明,它们在这些基础任务上遇到了困难,通常依赖于语义先验而不是实际的声音提示。为了解决这个问题,我们提出了 A2R,这是一个在具有说话者级硬底片 (CASH) 的反事实音频上优化的 30B 模型,该数据集旨在指导模型优先考虑声学声音线索而不是语言信号。 A2R 在 HEAR 上实现了强大的性能,并对不同的多说话人下游任务表现出零样本泛化,证明学习的说话人归因释放了模型说话人感知推理的潜在能力。所有资源均可在 https://attributetoreason.github.io/AttributeToReason/ 获取