论文

CultureVidBench:文本到视频生成中文化理解的基准测试

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

模型评测基准与评测资源

摘要

文本到视频(T2V)生成模型发展迅速,但其代表不同文化背景的能力仍未得到充分探索。现有的基准主要关注感知质量、物理合理性和文本视频对齐,但不直接评估生成的视频是否捕捉文化特定的对象、动作、仪式、可见文本或音频提示。我们推出了 CultureVidBench,这是一个评估 T2V 一代文化理解的综合基准。 CultureVidBench 包含 1,000 个精选提示,涵盖 12 个国家、6 大洲、8 个文化区域和 14 个文化方面,分为三类:物质文化、社会实践和表演以及仪式和典礼。 CultureVidBench 专为视频生成而设计,强调动态和多模式的文化表征,包括社交互动、仪式程序以及文化上适当的可见文本和音频。我们通过人类用户研究和基于 MLLM 的跨文化 忠实性、多模态文化渲染、语义依从性和感知质量的自动评估来评估七个代表性 T2V 模型。结果表明,尽管当前的模型实现了很强的语义依从性和视觉质量,但它们往往无法忠实地捕捉细粒度的文化细节,特别是对于代表性不足的地区、仪式和多模式文化线索。