论文
UniAudio-Token:通过通用音频感知增强语义语音标记器
UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception
摘要
由于其紧凑的单码本设计和强大的语言对齐,语义语音标记器已成为 Audio-LLM 广泛使用的接口。然而,它们对语言抽象的关注导致了声盲,限制了它们在以语音为中心的任务之外的适用性。我们提出了 UniAudio-Token,这是一个框架,可以在不影响语音能力的情况下为语义标记器提供一般的音频感知能力。 UniAudio-Token 没有改变语义范式,而是通过两个关键创新来减轻其信息丢失:(1)语义声学原语(SAP)通过将音频分解为语言内容、声音属性和听觉场景原语来提供结构化监督; (2)语义声学平衡(SAE)引入了内容感知门控机制,可以自适应地从浅层恢复细粒度的声学细节。广泛的评估表明,UniAudio-Token 可以学习全面的通用表示,同时保留高保真语音生成。当与下游 LLM 集成时,它在理解和生成任务上优于所有单码本基线分词器,有效地充当统一的音频接口。我们在 https://github.com/Tencent/Universal_Audio_Tokenizer 公开发布了所有代码,包括训练和推理脚本以及模型检查点。