论文
评估多模态模型对好莱坞热门电影的叙事理解
Evaluating Multimodal Narrative Understanding of Popular Hollywood Films
摘要
多模态语言模型日益显示出支撑大规模电影计算分析的潜力,为研究电影史和叙事技巧的演化开辟了新途径。但围绕好莱坞电影构建稳定基准,受到版权保护的制约。本工作直接应对这些问题,按两项标准构建一个新的好莱坞电影集合:一是票房热度(我们首次发布了 Variety 杂志 1922–1979 年每周票房收入的大规模开放数据集);二是可能的公有领域状态(通过研究《美国版权登记目录》中的版权登记与续展记录)。我们在此集合之上构建了一个新的多模态多选题(MCQ)基准,聚焦于能直接评估模型能力、为电影叙事研究提供有意义信息的叙事元素;我们发现许多视觉语言模型在此任务上表现挣扎(许多接近随机水平的准确率),而视听模型(包括在场景描述中使用音频的模型)最高准确率为 61.1%,远低于人类水平。
