论文
SlotVTG:以对象槽位改善视频时间定位的跨域泛化
SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding
摘要
多模态大语言模型在视频时间定位中已有较好表现,但粗粒度识别不足以支持细粒度时间理解,通常需要任务微调。这可能使模型记住数据集特有的捷径,而非依据实际视觉内容,降低域外泛化。以对象为中心的学习可将场景分解为实体级表示,但既有方案需要重新执行多阶段训练。SlotVTG以较低开销引导模型进行以对象为中心、依据输入内容的视觉推理。轻量槽位适配器通过槽注意力将视觉词元分解为抽象槽位,再重建原始序列;自监督视觉模型提供对象先验,促进语义一致的槽位形成。在标准视频时间定位基准的跨域评测中,该方法提高域外鲁棒性,同时以较低额外开销保持域内表现。