论文
STORM-Bench:不完整动态证据下的在线视频问答
STORM-Bench: Evaluating Online Video QA under Evolving and Incomplete Evidence
摘要
可靠的在线视频问答需要跟踪状态转换,同时在视觉证据不足时选择性放弃。现有的基准侧重于静态识别或长程检索,很少在不断发展和不完整的证据下评估这些耦合功能。我们提出了 STORM-Bench,包括 5,736 个问题,跨越 630 个紧凑的、变化密集的片段,跨越五个自我中心域 (STORM-Real) 和两个受控模拟子集 (STORM-Sim),帧速率为 1 FPS。问题按累积变化强度(低、中、高)和查询时可回答性(已知、不确定)的代理进行分层。为了衡量可靠性,我们引入了 STORM-BR,这是一种针对联合答案状态正确性的谐波度量,可暴露被总体准确性掩盖的弃权失败,以及用于不确定性归因的 STORM-BR-ATTR。在 14 个视频大语言模型中,在线准确率峰值为 60.3\%(平均 51.7\%),而 STORM-BR 的范围从 5.7\% 到 35.6\%(平均 18.8\%),这是由于对不确定查询普遍过度自信所致。 STORM-Bench 表明,任务准确性掩盖了认知可靠性和状态跟踪方面的这些差距。基准和代码可在 https://github.com/siruzhong/STORM-Bench 获取。
