论文
在语言模型运行之前,音频词元的注意力是可预测的
Audio Token Attention Is Predictable Before the Language Model Runs
摘要
大型音频语言模型(LALM)将一分钟语音转换为750—1,500个词元,并对所有词元预填充。图像词元剪枝通常发生在语言模型最初几层之后,因为图像词元在这些层获得的注意力较少。音频词元在这些层获得更多注意力,且排序尚未稳定,因此音频需要在语言模型运行前排序。令人意外的是,仅凭编码器输出,就能在线性层面预测音频词元在语言模型各层将获得的注意力。无需标签、以闭式解拟合的线性映射,在13个LALM中的11个上,对全层注意力排序的预测相关系数达到ρ≥0.69。我们的方法Triage据此剪除音频词元;多项选择任务还在第2层依据实际注意力修正预测,再次剪枝。Triage无需标签设置压缩程度,采用两个预算,限制输出偏离模型完整音频输出的程度。保守预算下,词错误率与准确率相对完整音频的差异保持在0.04以内。更激进预算下,Triage在全部12种转录情形中优于所有基线。多项选择任务中,在2.2—5倍压缩下,其平均准确率比平均表现最强的基线DART高0.043。由于在语言模型运行前剪枝,Qwen2.5-Omni-3B上下文窗口可容纳的音频从21.8分钟增加到约62分钟。在压缩最强的配置下,单张GPU可服务的该模型并发5分钟音频流数量达到4倍。项目页面:https://audio-triage.github.io