论文

EVIDENT:通过基于实体的视觉证据路由 MLLM 适应以实现跨域视频时间定位

EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding

模型训练参数高效训练

摘要

用于视频临时定位 (VTG) 的 微调 MLLM 通常会提高域内性能,但在域移位时会急剧下降。在这项工作中,我们发现这种失败主要不仅是由看不见的查询概念驱动的,而且是由视觉域转移引起的,这阻止了模型将其学习的时间定位知识与其固有的实体注意能力相结合。为了解决这个问题,我们引入了 EVIDENT,这是一种参数高效的适应框架,通过显式视觉实体证据路由 VTG 适应,将时间基础锚定在预训练 MLLM 的固有实体注意力中。 EVIDENT 由三个组件组成:(i) 实体瓶颈适配器,将密集的视觉标记转换为紧凑的实体级槽;(ii) 实体绑定 蒸馏 损失,将对象性先验灌输到语义非结构化的 MLLM 视觉空间中,引导每个槽绑定到连贯的实体;(iii) 实体到证据门控机制,利用捕获的实体作为证据,引导模型进行本地化包含查询相关实体的时刻。这些组件共同使 VTG 微调 能够依赖基于实体的证据,而不是脆弱的数据集快捷方式。跨域 VTG 基准测试表明,EVIDENT 持续提高域外稳健性,同时以适度的参数开销保持有竞争力的域内性能。这些结果表明,实体级基础是可推广时间定位的有效归纳偏差。