论文
文化时刻基准:评估视频在东南亚的文化推理和落地
Cultural Moment Benchmark: Evaluating Video Cultural Reasoning and Grounding in Southeast Asia
摘要
视频中的文化理解不仅仅意味着识别可见的内容;还意味着理解视频中的文化。它需要掌握文化概念的象征意义和时间意义。我们将其分解为三种能力:命名概念所代表的含义、在视频中视觉识别它以及及时定位其子事件。现有的视频文化基准倾向于测试所看到的内容,将这三种能力分解为隐藏瓶颈的单一分数。我们介绍文化时刻基准 (CMB):来自东南亚 7 个国家的 5 个类别的 306 个专家策划的概念。我们通过三个阶段评估每个概念,每个阶段一个能力。给定描述,阶段 1 (S1) 从四个候选概念名称中进行选择,阶段 2 (S2) 从四个候选视频时刻中进行选择,阶段 3 (S3) 预测视频中该时刻的开始和结束时间。为了使每个阶段专注于不同的能力,我们使用三种设计选择:语义相似性干扰项(S1、S2)、未标记的视频时刻(S2)和不同示例视频上的自由形式本地化(S3)。在六种视觉语言模型中,故障模式因能力和模式而异。 i) 当所有三个阶段都必须正确时,即使是最强的闭源模型得分也低于 30%; ii)三种能力并不完全级联:正确命名一个概念有助于一半模型在视频中识别它,但识别它对及时定位子事件影响不大; iii) 音频是互补的、冗余的或分散注意力的,具体取决于概念,在非拉丁文字国家中更常见的是分散注意力;删除音频和字幕对游戏和音乐的伤害最大。我们的 14 名评估者人类研究表明,即使是专家评估者对邻国概念的得分也低于机会,这表明 CMB 需要特定国家的文化知识。 CMB 充当诊断工具,将故障归因于特定的能力或模式。