论文

用于时间动作定位的掩蔽扩散视觉语言模型

Masked Diffusion Vision-Language Models for Temporal Action Localization

模型训练监督微调与指令调优

摘要

时间动作定位 (TAL) 需要识别目标事件并在未修剪的视频中精确定位其开始和结束时间。最近的视觉语言公式改进了语义推理并支持语言条件输出,但它们的自回归解码器仍然从左到右生成标记,从而防止后来的语义证据修改早期的时间戳预测。我们将掩蔽扩散视觉语言模型 (MDVLM) 应用于 TAL,以便语义标记和边界标记在双向注意力的迭代去噪过程中保持可编辑,从而允许联合细化时间边界和语义内容。然而,直接适应会产生两个特定于 TAL 的不匹配:标准掩码扩散训练会随机均匀地破坏所有位置,但当有足够的语义上下文可用时,时间标记会更可靠;而词元级交叉熵不反映时间IoU。为了解决这些不匹配问题,我们引入了一个计划训练目标,该目标使用边界感知掩蔽和步进加权重建来演练时间标记的后期恢复,以及在去噪期间提供重叠感知监督的步进级 IoU 奖励。标准序列级交叉熵项提供基础重建信号。 ActivityNet-RTL、ActivityNet-1.3 和 THUMOS-14 上的实验表明,MDVLM-TAL 相对于自回归视觉语言基线改善了时间推理和边界定位,在更严格的时间 IoU 标准下,效果尤其强劲。