论文
STRAND:视频大语言模型中以对象为中心的时空监控的基准测试和改进
STRAND: Benchmarking and Improving Object-Centric Spatio-Temporal Monitoring in Video Large Language Models
摘要
虽然多模态大语言模型 (MLLM) 具有先进的视频理解能力,但它们在动态场景中仍然很容易产生幻觉。我们认为这源于时空监控的失败,以及随着时间的推移持续跟踪对象身份、状态和关系的能力。现有的基准通过依赖对查询的单一最终答案评估来掩盖这一缺陷,而这些查询通常可以通过本地视觉提示或统计先验来解决。为了严格诊断这一点,我们引入了 STRAND,这是一个经过人类验证的以对象为中心的事实的基准,它通过将查询分解为子问题来评估中间推理,区分真正的时间理解和巧合的正确性。至关重要的是,我们使用“忠实准确性”对模型进行评分,这是一种无条件联合指标,仅当目标答案和每个先决子问题都正确时才对预测进行评分,这样模型就不会通过在它碰巧回答正确的一小部分目标上选择性地保持一致来夸大其分数。为了解决 STRAND 暴露的故障模式,我们进一步提出了一个以对象为中心的框架,该框架通过逐块状态提取和时间聚合显式构建和推理结构化对象轨迹。广泛的实验,包括与端到端 MLLM 和模块化视频工具的骨干、帧、调用和词元匹配比较,表明我们的以对象为中心的框架显着减少了幻觉答案,并提高了与最先进的 MLLM 相比的时空推理一致性。代码、模型和数据已在此 http URL 上提供。