论文
EvA:LALM 的循证第一音频理解范例
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
摘要
大型音频语言模型(LALM)在复杂的声学场景中仍然举步维艰,因为它们通常无法在推理开始之前保留与任务相关的声学证据。我们将这种错误模式确定为证据瓶颈:最先进的系统在声学证据提取方面表现出比下游推理更大的缺陷,这表明上游感知往往是限制因素。为了解决这个问题,我们提出了 EvA(证据优先音频),这是一种双路径架构,通过分层聚合和非压缩、时间对齐融合来增强声学证据保存。我们还构建了 EvA-Perception,这是一个大型训练集,包含约 54K 个事件排序的音频描述和 500K 个基于证据的 QA 对。在统一的零样本协议下,EvA 在 MMAU、MMAR 和 MMSU 上实现了最好的开源 \emph{Perception} 结果,在感知重的分裂上获得了最大的收益。对开放式音频描述的人工评估进一步表明,细粒度的声音覆盖范围和音频描述质量得到了改善。这些结果支持证据优先的假设:更强的音频理解取决于在推理之前保留声学证据。项目可以在 https://satsuki2486441738.github.io/EvA/ 找到。