论文

CinematicVQA:大型视觉语言模型中的电影语法推理基准测试

CinematicVQA: Benchmarking Film-Grammar Reasoning in Large Vision-Language Models

模型评测基准与评测资源

摘要

电影摄影是通过取景、灯光和摄像机操作来讲述视觉故事的技巧,从根本上塑造了观众对视频内容的感知和情感参与方式。虽然大视觉语言模型 (LVLM) 在视频问答方面取得了显着进展,但现有基准主要侧重于识别低级技术,而不是了解其讲故事的影响。为了解决这个问题,我们引入了 CinematicVQA,这是电影视频理解的首个基准,它超越了技术识别来评估电影语法推理,利用我们引入的电影场景图 (CSG),一种将电影技术与其感知效果和叙事功能联系起来的结构化表示。通过对最先进的 LVLM 的综合评估,我们揭示了一个显着的语义差距:模型在描述视觉呈现方面的表现始终高于在识别底层技术方面的表现。令人惊讶的是,思想链提示无法为大多数模型提供一致的增益并降低性能,这表明当前的 LVLM 缺乏足够的电影领域知识来从逐步推理中受益。对 \textsc{CinematicVQA-train} 进行微调会产生一致的改进,特别是对于叙事功能和多跳推理。总的来说,\textsc{CinematicVQA} 既可以作为 LVLM 中电影评估的严格基准,也可以作为训练更多电影感知视频模型的实用数据集。