论文

CineCap:经时空锚点的结构化推理电影摄影视频描述

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

模型训练强化学习

摘要

电影摄影描述旨在用专业电影语言概念——如运镜、景别、景深、构图与拍摄角度——描述视频如何被拍摄。该能力对细粒度视频理解与可控电影级视频生成很重要——但在既有多模态大语言模型中仍少被探索。不同于基于问答的电影理解评估——电影摄影描述需要对多个摄影维度的统一开放式描述。该任务难在两点:模型必须从细微视觉证据推断专业摄影概念——且必须生成既全面又准确的描述。因此——我们提出CineCap——组合结构化推理与时空锚点——以及带全面性、准确性与门控覆盖奖励的强化学习的框架。前者把专业摄影描述锚定到显式视觉证据——组织为紧凑原子推理用于监督微调;后者改善描述完备性与事实正确性间的平衡。此外——我们构建CineCap Bench——472个人工标注视频-描述对的系统评估基准。大量实验表明CineCap持续超越强专有与开源基线——创下电影摄影描述的新SOTA。代码、模型检查点与基准公开于 https://github.com/Hectormxy/CineCap.git。

CineCap:经时空锚点的结构化推理电影摄影视频描述:论文配图
图 1.我们的 CineCap 和基准比较的案例研究。 (a) 演示视频序列的思维过程,其中特定的电影属性(如摄像机运动和镜头大小)是从空间锚点推断出来的。 CineCap 显然提供了比通用基线更全面、更准确的摄像机运动描述。 (b) 雷达图显示基准结果,表明 CineCap 在多个电影维度上优于现有的视觉语言模型。