论文

PercepCap:具有结构化时空感知的视频视频描述器

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

模型训练强化学习

摘要

视频视频描述需要对视频进行细粒度的时空理解,包括对象所在位置的空间感知和事件发生时间的时间感知。现有的 MLLM 通常直接从视频输入生成视频描述,而不暴露描述背后的感知证据。因此,时空感知的错误只能在最终的视频描述中观察到,从而很难直接识别潜在的感知错误。为了解决这些问题,我们提出了 PercepCap,一种感知感知的视频视频描述框架,可以在生成最终视频描述之前使感知证据变得明确。具体来说,PercepCap 遵循感知-描述生成链,其中模型首先生成包含对象轨迹和时间事件的时空感知轨迹,然后生成以感知证据为条件的最终标题。为了支持这一点,我们设计了一个两阶段的训练策略。感知然后描述监督 微调 将模型从仅标题生成调整为所提出的感知描述链,而基于感知的强化学习通过感知链和最终标题的联合奖励来优化感知轨迹和标题质量。为了支持我们的两阶段训练,我们引入了标题锚定感知数据构建。该管道首先生成仅包含视频描述的描述,提取其中提到的对象和事件,然后将它们带回带有框和时间戳的视频中,从而构建 SFT 和 RL 训练数据。这会产生与标题对齐的感知数据,提供可靠的训练 真值,确保显式感知轨迹和最终标题引用相同的对象和事件。在直接视频描述和视频描述到 QA 评估中,PercepCap 持续改进 Qwen3-VL 基线,并展现出领先的视频描述质量。