论文

VoiceGiraffe:极端长上下文音频语言理解的基准

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding

模型评测基准与评测资源

摘要

虽然大型音频语言模型(LALM)在秒级或分钟级音频处理方面取得了显着进展,但理解小时级音频仍然是一个基本瓶颈。现有的基准主要依赖于短片或人为连接的片段,无法忠实地评估 LALM 在播客和冗长演讲等现实场景中的远程信息理解能力。为了解决这一差距,我们引入了 VoiceGiraffe,这是一种新颖的基准,旨在在长上下文设置下跨不同的现实场景、模式和语言严格评估 LALM。它由 1500 个精心策划的三元组组成,构成单跳感知和多跳推理的双层分类法。我们根据人类表现评估一系列开源和专有的 LALM。结果强调了三个基本发现。首先,VoiceGiraffe 仍然具有很高的挑战性,并且远未达到饱和。其次,我们表明没有任何一种推理范式能够普遍占据主导地位。 E2E 推理有利于具有本机长上下文音频理解的模型,级联描述文本聚合可稳定被小时级音频淹没的小型模型,而与外部 LLM 的推理增强级联有助于较弱的模型,但可能会成为更强的专有系统的瓶颈。第三,我们揭示了远程记忆持久性是一个关键瓶颈。 LALM 更擅长回答需要连接显着因果线索的问题,而不是那些需要在长音频中持续跟踪稀疏事件的问题,而人类则表现出相反的模式。这些发现将 VoiceGiraffe 定位为长格式音频理解的具有挑战性的诊断测试平台,凸显了对具有持久记忆和强大的远程聚合功能的 LALM 的需求。