论文

CultureScore:评估视频生成模型中的文化 忠实性

CultureScore: Evaluating Cultural Faithfulness in Video Generation Models

模型评测基准与评测资源

摘要

随着 Veo 3.1 和 LTX-2 等视频生成模型的进步,它们准确代表不同全球文化的能力仍然是一个关键但尚未得到充分研究的前沿领域。当前的指标(例如 VideoScore)仅衡量视觉质量,但没有提供评估文化 忠实性 的机制。因此,用握手代替合十礼的模型获得的分数与正确生成手势的模型相同。我们提出了 CultureScore,一个构成评估框架,它将文化 忠实性 分解为三个粒度维度:身份(代表谁)、语境(文化本地化背景)和行为(规范手势和互动)。我们通过跨越 10 个国家/地区的评估套件来实施该框架,在三个最先进的模型中生成了 6,174 个生成的视频。我们的评估表明,当前模型没有实现文化忠实的视频生成:表现最好的模型仅达到总体 CultureScore 的 56.8%,其中行为是最具挑战性的维度;没有一个模型的行为超过 52.1%。此外,视觉质量得分最高的模型(LTX-2)被本地注释者排名最后,而 CultureScore 的行为维度在我们评估的自动指标中显示出与人类文化判断最强的正相关性,强调文化 忠实性 是公平视频生成的重要标准。数据和代码是公开的。\footnote{\url{https://huggingface.co/datasets/ankurani/CultureScore}}