论文
Vox-Infinity:长上下文口语模型极限的基准测试
Vox-Infinity: Benchmarking the Limits of Long-Context Spoken Language Models
摘要
长上下文理解仍然是大型语言模型的基本挑战,因为过长的输入通常会导致模型忘记显着信息。这个问题在语音领域更为明显,其中音频作为一种低压缩模态,需要比文本更多的嵌入才能保留语义内容和声学线索。为了应对这一挑战,我们引入了 \textbf{Vox-Infinity},这是第一个专门为评估口语模型中的长上下文理解而设计的基准。 Vox-Infinity 沿着两个维度系统地扩展音频历史:回合计数和回合持续时间。它涵盖了具有不同交互结构和语义复杂性的各种代表性场景。至关重要的是,Vox-Infinity 提供了明确的答案来源注释,并根据解决每个查询所需的历史上下文量来组织样本,从而实现精确且长度感知的评估。对七个代表性口语模型的广泛评估揭示了明显的整体新近效应:当支持答案的证据更接近查询时,模型通常会实现更高的准确性,但很难检索和使用位于对话历史中更靠前的证据。案例和数据集可从此 https URL 获取。