论文
AudioLens:具有推理音频语言模型的多视角语音聚类
AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models
摘要
音频聚类是组织快速增长的语音集合、支持会话分析和语音驱动发现等应用程序的一项基本任务。然而,现有方法依赖于固定的声学相似性度量或基于 ASR 的文本管道,限制了它们在不同用户指定的视角下重新组织相同音频集合的能力,特别是当聚类依赖于语言和副语言线索时。我们引入了音频多视角聚类,其中模型根据自然语言视角直接划分语音记录,同时推断聚类的数量及其分配。为了研究这种设置,我们构建了 AudioLens-Bench,这是一个跨越多个应用领域的基准,并评估透视和跨透视泛化。我们进一步提出了 AudioLens-R1,这是一种通过推理 蒸馏 和偏好优化进行训练的端到端大型音频语言模型。实验表明,AudioLens-R1 始终优于所有基线,整体 ARI 提高了 12.99 点,V-measure 提高了 11.62 点。这些结果证明了原生音频语言模型在语音集合上灵活、以视角为条件的结构发现的前景。