论文
分层声学语义建模:全双工 SLM 的模态分离和语义一致性
Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs
摘要
开发无缝、高性能、本机智能全双工口语模型 (SLM) 仍然是语音和 NLP 社区的一项关键挑战和长期目标。尽管取得了显着的进展,但最近的努力从根本上受到严重的模态干扰的限制,这会导致大量的知识退化并损害语义完整性——最终使全双工 SLM 感觉不自然和不智能。在本文中,通过对模型优化动力学进行详尽的细粒度分析,我们揭示了这种性能下降的根本原因,揭示了当两种模态被迫共享深层参数空间时,模态干扰是由声学和语义建模之间固有的梯度冲突引起的。在这一关键见解的指导下,我们推出了 Lychee-FD,这是一种旨在减轻模态干扰的本机端到端全双工框架。重要的是,我们提出了一种分层参数分离策略,该策略可以解耦深层中的冲突模态,同时通过专用的语义对齐通道保持跨模态的一致性。对多个全双工基准的大量实验表明,我们的方法显着提高了现有技术水平,在语音智能(Spoken QA 上+7.4%)和全双工交互流动性(FullDuplexBench 1.5 上+28.5%)方面产生了显着的改进,而不影响推理效率。据我们所知,这项工作首次实现了两个关键进展:1)揭示并阐明了全双工 SLM 中模态干扰的根本原因,2)为无缝、高性能、本机智能全双工 SLM 设计了一个优雅的分层模型以及实用的解决方案。