论文

声音作为句柄:用冻结文本大语言模型推理说话者身份

Voices as Handles: Reasoning about Speaker Identity with Frozen Text LLMs

模型训练参数高效训练

摘要

多用户语音Agent必须跟踪对话会话中谁说了些什么。文本大语言模型对于此类Agent来说是有吸引力的支柱,但仅凭文字记录并不能暴露声学说话者的身份,从而使模型没有持久的参考来将信息与会话中的说话者链接起来。我们通过引入说话人句柄(Speaker Handles)来解决这一差距,这是一种软词元表示,可将声学说话人身份暴露给冻结文本 LLM,以进行跨会话说话人相关推理。三阶段课程训练一个轻量级投影器,其主干参数不到 0.1%,将说话人嵌入映射到这些手柄中。确定结果处理是否真正支持跨会话依赖于说话者的推理对于现有基准来说具有挑战性,因为文本提示可以部分揭示事实所有权。因此,我们提出了SpeakerBind,这是一种受控共享代理基准,其中用户之间的重叠事实需要正确的跨会话说话者归因。说话人句柄在 VoxCeleb1 上实现了 97.40-98.36% 的准确率,在SpeakerBind 上实现了 70.40% 的准确率,接近 71.88% 的顶线。这些结果表明,所提出的说话人句柄提供了一种将声学说话人身份集成到冻结文本 LLM 中以进行说话人内容推理的有效方法。