论文

CineSubBench:评估大语言模型对多语言电影字幕的长篇叙事和文化理解

CineSubBench: Evaluating LLMs on Long-Form Narrative and Cultural Understanding from Multilingual Movie Subtitles

模型评测基准与评测资源

摘要

大语言模型越来越多地在法律、医学、软件工程和网络安全等专业领域得到评估,但尽管电影需要长篇叙事整合、多语言解释和文化背景下的观众判断,但它的探索相对不足。我们介绍 CineSubBench,这是一个评估多语言电影字幕的长上下文电影理解的基准。字幕轨道将电影表示为数千个简短的、按时间顺序排列的话语,模型必须从中重建人物、关系、事件、因果进程和主题,而无需明确的场景或事件结构。 CineSubBench 包含 1,012 部电影,具有六种语言的完整字幕覆盖,产生 6,072 首曲目和 813 万个带时间戳的字幕条目。它提供了匹配的多任务、多语言和多文化 (MultiX) 评估设置:七个任务涵盖叙事重建和抽象、类型预测、年龄适宜性、十个国家分类系统的特定国家电影评级以及基于字幕的语言安全。在九个大语言模型中,情节场所的恢复比事件完整概要更可靠;跨语言一致性在不同模型和语言之间存在很大差异;国家评级系统暴露出不同的校准模式;强烈的脏话比轻微的脏话更容易消除。 CineSubBench 将电影确立为长语境的 LLM 评估领域,并为衡量叙事、多语言、文化和证据基础能力提供统一的基准。