论文

TAKE 85:测试视听电影制片人在 85 小时电影中的意图

TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

模型评测基准与评测资源

摘要

电影通过深思熟虑的创意选择进行交流,包括灯光、色彩、构图、剪辑、对话、音乐和声音。人类自然地将这些信号解释为指挥意图,但当前的多模态 大语言模型 (MLLM) 几乎完全是根据理解发生的情况而不是为什么以这种方式呈现来评估的。我们推出 TAKE 85,这是理解导演意图的第一个基准,由 398 部短片(85 小时)组成,其中包含经过专家验证的问答对,涵盖全球和细粒度的视觉和音频意图。通过受控模态消融,TAKE 85 能够对多模态推理进行系统评估。对最先进的 MLLM 的实验揭示了感知识别和有意理解之间的巨大差距:虽然模型准确地描述了事件和叙述,但它们始终无法推断出电影制作决策的沟通作用。我们的结果将指导意图确立为多模态理解的一个先前被忽视的维度:即使是最强的模型也只能达到 100 个中的 58 个,并且我们的消融表明没有任何输入模态本身是足够的。所有代码、问答和模型均可从 https://github.com/KaiShinozakiConefrey/Take-85 公开获取