论文
ATIR:音频与文本交错的上下文检索
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
摘要
音频比文本承载更丰富的信息,包括情感、说话者特征和环境背景,同时与语音到文本管道相比,还可以实现更低延迟的处理。然而,最近的多模态信息检索研究主要集中在图像上,很大程度上忽视了音频,特别是在交错的音频文本上下文检索的设置中。在这项工作中,我们引入了音频文本交错上下文检索(ATIR)任务,其中查询可以在音频和文本模式之间交替。我们通过集成多个自动语音识别 (ASR)、QA 和检索数据集来构建 ATIR 基准,最终统一四种类型的上下文检索任务。该基准基本上解决了现有音频检索数据集在语义检索中的局限性。为了研究这项任务,我们评估了几个现成的 检索器 并基于多模态 大语言模型 (MLLM) 训练我们的 ATIR 模型。我们进一步引入了一种与现有压缩方法正交的新型词元压缩机制,从而缓解了基于 MLLM 的 ATIR 模型中过多音频词元的问题。实验结果表明,我们的 ATIR 模型比强大的基线取得了实质性的改进。