论文
CAVE:视频时序定位的能力感知视觉边界证据对齐
CAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal Grounding
摘要
大型视觉语言模型 (LVLM) 通过强化学习 (RL) 在视频时序定位 (VTG) 方面取得了显着的性能提升。然而,现有的方法主要依赖于结果正确性奖励,仅评估最终的预测间隔,从而使与边界相关的视觉证据及其与时间戳预测的对应关系受到充分的约束。在本文中,我们深入研究了时间戳预测及其底层边界级视觉证据,显示了广泛使用的基准中视觉证据和预测时间戳之间普遍存在的不一致。为了解决这个问题,我们提出了能力感知视觉边界证据对齐(CAVE),它通过特定于边界的视觉证据奖励来增强本地化优化,以减轻证据时间戳不一致。具体来说,为了明确表示特定于边界的视觉证据,CAVE 引入了特定于边界的证据标记,并通过轻量级监督预热来初始化其结构化生成和不同的边界语义。在强化学习期间,视觉边界证据对齐奖励强化了 真值 边界内特殊证据标记的视觉注意力,从而促进视觉证据和时间边界之间的对齐。此外,用于证据监督的性能感知门控旨在自适应地保留对定位不佳的群体的证据指导,同时在定位变得足够准确时减少证据指导,以避免过度约束细粒度边界细化。对多个公共 VTG 基准的大量实验证明了我们方法的有效性。