论文

TraceAV-Bench:对长视听视频的多跳轨迹推理进行基准测试

TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

模型评测基准与评测资源

摘要

现实世界的视听理解需要链接稀疏的、时间上分散的、跨视觉和听觉流的证据,而现有的基准在很大程度上无法评估这种能力。他们将视频限制为短片,隔离模式,或将问题减少为一跳感知。我们推出了 TraceAV-Bench,这是第一个联合评估长视听轨迹多跳推理和多模态幻觉鲁棒性的基准。 TraceAV-Bench 包含 578 个长视频中的 2,200 个经过严格验证的多项选择题,总计 339.5 小时,涵盖 4 个评估维度和 15 个子任务。每个问题都基于明确的多跳证据轨迹,在 15.1 分钟的时间跨度内平均有 3.68 跳。该数据集是通过三步管道构建的,然后是严格的质量保证流程。在 TraceAV-Bench 上对多个代表性 OmniLLM 的评估表明,该基准对所有模型都构成了持续的挑战,最强的闭源模型(Gemini 3.1 Pro)在一般任务上仅达到 68.29%,而最好的开源模型(Ming-Flash-Omni-2.0)达到 51.70%,还有很大的空间。进一步的分析表明,当前的模型很难收集和合并长视听视频中的证据,并且性能因模式和推理任务而异。我们希望 TraceAV-Bench 将促进 OmniLLM 中可靠的长格式视听推理的进展。