论文
追踪真相:以对象为中心的视频时空监控 大语言模型
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
摘要
虽然多模态 大语言模型 (MLLM) 具有先进的视频理解能力,但它们在动态场景中仍然很容易产生幻觉。我们认为这源于时空监控的失败,以及随着时间的推移持续跟踪对象身份、状态和关系的能力。现有的基准通过依赖对查询的单一最终答案评估来掩盖这一缺陷,而这些查询通常可以通过本地视觉提示或统计先验来解决。为了严格诊断这一点,我们引入了 STEMO-Bench(时空监控),这是一个经过人类验证的以对象为中心的事实的基准,它通过将查询分解为子问题来评估中间推理,区分真正的时间理解和巧合的正确性。为了解决 STEMO 暴露的故障模式,我们提出了 STEMO-Track,这是一种新颖的以对象为中心的框架,它通过逐块状态提取和时间聚合来显式构建和推理结构化对象轨迹。大量实验表明,与最先进的 MLLM 相比,我们以对象为中心的框架显着减少了幻觉答案并提高了时空推理一致性。