论文
ReasonAudio:评测文本-音频检索中超越匹配的推理的基准
ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval
摘要
随着多模态内容快速扩张,音频检索已成为媒体搜索、内容组织与智能助手的关键赋能技术。但多数现有基准聚焦语义匹配,未能捕捉真实查询常需高级推理能力——否定理解、时序排序、并发事件识别与时长辨别。为填补缺口,我们提出ReasonAudio:首个面向文本-音频检索的推理密集型基准,含1,000条查询与10,000个合成音频片段,覆盖五项基础推理任务:否定、顺序、重叠、时长与混合。尽管这些任务对人类直观、构造直接,却给当前模型带来显著挑战。对十个SOTA模型的评估揭示:所有模型都在推理密集型音频检索上挣扎,否定与时长任务尤其差,重叠与顺序相对较好;且基于多模态大模型的嵌入模型经对比微调后未能继承其骨干的推理能力,说明当前训练范式不足以在检索 setting 中保留推理能力。
