论文
CineCap:经时空锚点的结构化推理电影摄影视频描述
CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning
摘要
电影摄影描述旨在用专业电影语言概念——如运镜、景别、景深、构图与拍摄角度——描述视频如何被拍摄。该能力对细粒度视频理解与可控电影级视频生成很重要——但在既有多模态大语言模型中仍少被探索。不同于基于问答的电影理解评估——电影摄影描述需要对多个摄影维度的统一开放式描述。该任务难在两点:模型必须从细微视觉证据推断专业摄影概念——且必须生成既全面又准确的描述。因此——我们提出CineCap——组合结构化推理与时空锚点——以及带全面性、准确性与门控覆盖奖励的强化学习的框架。前者把专业摄影描述锚定到显式视觉证据——组织为紧凑原子推理用于监督微调;后者改善描述完备性与事实正确性间的平衡。此外——我们构建CineCap Bench——472个人工标注视频-描述对的系统评估基准。大量实验表明CineCap持续超越强专有与开源基线——创下电影摄影描述的新SOTA。代码、模型检查点与基准公开于 https://github.com/Hectormxy/CineCap.git。
