论文
SpeakerLLM:说话人专用音频-LLM,用于说话人理解和验证推理
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
摘要
随着音频优先代理在物理人工智能、会话机器人和无屏可穿戴设备中变得越来越普遍,音频 大语言模型 (audio-LLM) 必须集成特定于说话者的理解,以支持用户授权、个性化和上下文感知交互。这需要对谁在说话、声音听起来如何以及录音条件如何影响说话者提示进行建模。传统的说话人验证系统提供了强大的标量分数,但几乎没有语言证据,而当前的音频 LLM 和说话人感知语言模型在组织二进制标签或描述性配置文件之外的说话人信息的能力有限。我们提出了SpeakerLLM,这是一个说话人专用的音频LLM框架,它在自然语言界面中统一了单话语说话人分析、录音条件理解、话语对说话人比较和证据组织的验证推理。我们构建验证推理目标和决策组合策略,将配置文件级证据与最终相同或不同的决策分开,并将记录条件、配置文件证据和决策组织成结构化跟踪。其核心是,SpeakerLLM 使用分层说话人分词器,旨在捕获多个粒度的说话人证据。话语级说话人嵌入总结了身份和个人资料级线索,而帧级说话人特征保留了细粒度的声学描述符。实验表明,与一般音频 LLM 相比,SpeakerLLM-Base 提高了对说话者配置文件和录音条件的理解,而SpeakerLLM-VR 保留了强大的生成判决准确性,并生成基于监督验证推理模式的决策轨迹。我们将发布元数据丰富的监督数据集和目标构建代码以实现可重复性。