论文

大型音频语言模型的音频压缩下的任务感知答案保存

Task-Aware Answer Preservation under Audio Compression for Large Audio Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

大型音频语言模型 (LALM) 越来越多地对长音频片段进行推理,从而推动音频压缩以减少内存使用和推理延迟。然而,音频压缩可以使模型的整体答案准确性可以接受,同时严重降低特定查询系列的准确性。我们引入了一个框架,通过测量 LALM 应答错误相对于未压缩音频的增加来审核给定的音频压缩方法。我们形式化了一个接受标准,限制每个所需查询系列的这种增加,并得出一个实用的协议,用于以统计置信度测试压缩设置。涵盖五个多项选择音频问答基准和四个 LALM 的实验揭示了整体准确性所隐藏的压缩引起的损坏。