论文
通过结构化说话人调节实现耳语的稳健多层以婴儿为中心的音频理解
Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning
摘要
模型设计和自监督音频表示的最新进展改善了语音和音频理解,但由于标记数据有限、信噪比低和跨家庭域转移,以婴儿为中心的自然录音仍然具有挑战性。我们提出了一种家庭调节的多层音频标记器,它将 LoRA 微调的 Whisper 编码器与轻量级、目标说话者感知的 Transformer 相结合,用于跨层的长上下文推理和帧预测。为了提高时间一致性,我们采用了简单的序列级平滑损失,并为了增强家庭之间的鲁棒性,我们引入了具有共享层词元和学习的家庭特定偏移的因子化说话者词元设计,减少了家庭偏见并促进了普遍化的表示。这些选择共同实现了家庭环境中全天录音的高效且有效的以婴儿为中心的音频标记。