论文
TRACE:具有锚定和收敛证据的时间检索,用于长视野视频理解
TRACE: Temporal Retrieval with Anchored and Convergent Evidence for Long-Horizon Video Understanding
摘要
仅当从视频解码的帧涵盖答案所依赖的每个事件时,长视频答案才是有证据支持的。现有的评估对最终答案的正确性或预测的证据区间进行评分,但方法在回答之前解码的框架很少被审核,因此正确的答案仍然可以依赖于不完整的观察。我们推出了 VES-Bench,这是一个包含 348 个公共长视频的时间排序和事件计数项目的 600 个问题基准测试。每个项目都带有一组共同必要的证据区间,让我们在三个严格级别上审核方法的解码帧是否覆盖其中的每一个。我们还提出了 TRACE,一种 无需训练 代理,它将答案基于原始视觉剪辑,逐轮构建证据束,并且仅当答案随着束的增长而稳定并且对相同剪辑的最终传递返回相同的答案时才停止。在同骨干审计中,TRACE 在每个证据区间内至少有两个解码帧的情况下,正确回答了 50.7% 的问题,每个问题的帧数为 98.7:比 128 帧的统一解码(40.2%)高出 10 多分,比 256 帧的统一解码(帧成本为 0.39 倍)高出 2.6 分以内,同时达到了审计中的最高答案准确率(63.5%)。 TRACE 在 Video-MME (86.1)、LVBench (75.6) 和 LongVideoBench (75.1) 上也保持竞争力。