论文
MASRA:MLLM 辅助的视频时序定位的语义关系一致对齐
MASRA: MLLM-Assisted Semantic-Relational Consistent Alignment for Video Temporal Grounding
摘要
视频时间基础(VTG)面临跨模态语义差距,通常会导致背景特征与查询错误对齐,而直接将查询与时刻匹配会导致时间语义的辨别性和一致性不足。为了解决这个问题,我们提出了 MLLM 辅助语义关系一致对齐(MASRA),这是一种基于 MLLM 的 VTG 训练时优化框架。 MASRA 在训练期间利用 MLLM 来生成两种形式的文本先验,即具有时间跨度的事件级描述和剪辑级标题,并实例化两个 MLLM 辅助的对齐。事件语义时间对齐(ESTA)将时间上下文与事件语义对齐,以显式加强语义和时间事件之间的对应性,并提高跨度可分离性。局部关系一致性对齐(LRCA)构建从剪辑级字幕导出的文本关系矩阵,并将其与模型中的时间特征相似度矩阵对齐,在捕获局部结构信息的同时增强时间一致性。 MASRA 包括两个简单的支持模块,语义引导增强和二阶关系注意,以更好地利用学习到的语义上下文和关系结构。此外,我们引入了具有上下文感知码本的解耦对齐交互(DAI),以自适应地吸收与查询无关的语义并减轻跨模式差距。 MLLM 仅在训练期间调用,在推理时不使用。大量实验表明 MASRA 优于现有方法,消融研究验证了其有效性。