论文
TRACE:显式记录证据时点和响应条件的流视频评测
TRACE: Temporal Audit and Condition-aware Evaluation of Streaming Video Understanding
摘要
流媒体视频理解需要模型在证据到达时对其进行解释,但当前的评估通常报告任务分数,但没有指定证据何时有效、如何维护视觉历史记录或如何触发响应。因此,相似的分数可能对应于不同的工作负载、故障模式和操作行为。我们引入了 TRACE(时间审计和条件感知评估),这是一个使这些因素变得明确的条件感知基准和评估框架。 TRACE 将时间审计的视觉任务与证据计时和指令相关的触发注释相结合,统一的因果核心适配器协议在记录实际历史处理和响应事件的同时控制信息可用性,以及答案质量、及时性、响应选择行为、工作量、完成度和可靠性的多维报告。我们根据 517 个视频的 1,240 条记录,评估了八种配置的八种公开模型或系统。我们发现,几乎相同的 QA 准确性可以掩盖完成度、答案有效性和生成工作量方面的显着差异,而主动性能则分为响应质量、响应延迟、误报(在当前没有目标窗口有效时发出响应,但仍存在稍后的目标窗口)和错过目标窗口。这些结果表明,流视频性能应被解释为执行条件下的系统行为,而不是单一分数。我们的基准测试和代码可以在 \href{https://github.com/om-ai-lab/trace-bench}{https://github.com/om-ai-lab/trace-bench} 访问。