论文

我们是否需要为每个语音标记提供不同的表示?揭示和利用大型语音语言模型中的冗余

Do We Need Distinct Representations for Every Speech Token? Unveiling and Exploiting Redundancy in Large Speech Language Models

模型优化模型压缩

摘要

大型语音语言模型 (LSLM) 通常以高词元率(词元/秒)运行以确保声音保真度,但这会导致序列长度远远超过底层语义内容,从而产生过高的推理成本。在本文中,我们凭经验重新审视这种粒度 词元级 处理的必要性。通过分层预言机干预,我们推出了结构化冗余层次结构:浅层编码基本的声学细节,而深层则表现出极大的冗余,从而允许进行积极的压缩。受这些发现的启发,我们引入了 Affinity Pooling,这是一种基于相似性的词元合并机制 无需训练。通过在输入层和深层策略性地应用这种方法,我们可以在不损害语义信息的情况下有效地压缩语音表示。对三项任务的广泛评估表明,我们的方法将预填充 FLOP 减少了 27.48%,同时保持了有竞争力的准确性。实际部署进一步证实了显着的效率提升,可节省高达 $\sim$1.7$\times$ 的内存,并且在长话语中将首个词元的时间缩短 $\sim$1.1$\times$。我们的结果挑战了完全不同的词元表示的必要性,为 LSLM 效率提供了新的视角。