论文
DELTAVID:通过跨视频差异增强细粒度时空感知
DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences
摘要
视频多模态 大语言模型 在开放式视频理解方面取得了长足进步,但仍然缺乏精确的局部时空感知。当两个视频共享几乎相同的全局语义并且仅在很短的时间跨度或小区域内有所不同时,当前的模型通常无法发现变化并提供可靠的证据。我们提出了 DELTAVID,一种可验证的代理任务框架,可以增强具有跨视频差异的细粒度时空感知。关键思想是将跨视频找出差异转化为可训练的感知信号,其中模型识别局部变化,判断时间边界,并通过比较相似视频来组织空间证据。为了使该信号可扩展以进行训练并可靠地进行评估,我们进一步引入了 DELTAVID-10K 和 DELTAVID-Bench,它将真实视频中的可控局部差异转换为有证据标记的训练和测试样本。实验表明,DELTAVID 极大地提高了跨视频差异理解的性能,并将学习到的局部证据能力转移到通用视频理解基准,包括 MMVU、MLVU、Video-MME、VideoHolmes、VideoMMMU、LVBench、TempCompass 和 LongVideoBench。这些结果表明,跨视频差异不仅是诊断细粒度感知故障的有效方法,而且还是一种可扩展的代理监督,可将视频 MLLM 从粗略的语义理解转向细粒度的时空证据推理。