论文
音频语言模型中 无需训练 音频词元压缩的局部性很重要
Locality Matters for Training-Free Audio Token Compression in Audio-Language Models
摘要
音频语言模型 (ALM) 越来越多地用于音频字幕、问答和开放式音频理解,但当音频输入表示为长前缀词元序列时,其推理成本仍然很高。这些音频前缀会消耗上下文预算,增加内存使用量,并使资源受限或延迟敏感设置中的部署变得更加困难。现有的 无需训练 音频词元缩减方法主要依赖于固定池化或基于分数的剪枝。固定池与内容无关,而基于分数的修剪可以保留孤立的显着标记,但丢弃附近的声学上下文。我们提出了局部时间二分合并(LTBM),这是一种 无需训练 编码器空间压缩方法,可在显式时间窗口约束下合并相似的附近音频标记。除了引入 LTBM 之外,我们还使用受控的全局合并变体来隔离时间局部性本身是否是音频词元压缩的有用归纳偏差。使用 Qwen2-Audio 在 AudioCaps、Clotho 和 MMAU 上进行的实验显示了任务相关局部性效应的证据:局部性感知合并更有利于多种压缩设置下的字幕,尤其是在更强的压缩下,而全局匹配对于多选音频理解更具竞争力。 Audio Flamingo 3 上的跨主干验证进一步支持了在适度和激进压缩下的局部感知合并的字幕端优势。