论文

当文化移动时:衡量和改进多元文化文本到视频的生成

When Cultures Move: Measuring and Improving Multicultural Text-to-Video Generation

应用与实践内容创作

摘要

文本到视频 (T2V) 生成在视觉保真度方面取得了快速进步,但其在单个提示中忠实代表多种文化的能力仍未得到充分探索。我们引入了 MAVEN,这是一个多智能体快速细化框架,旨在提高单一文化和跨文化 T2V 一代的文化保真度。 MAVEN 将提示分解为人员、操作和位置维度,并由并行或顺序操作的专门代理处理。为了支持系统评估,我们提供了一个新基准,包含 243 个基于文化的提示和 972 个相应视频,涵盖三种文化(中国、美国、罗马尼亚)、三个动作类别以及单一文化和跨文化场景。结合基于 CLIP 的指标、VLM 作为评判评估和视频质量测量的评估表明,多智能体细化,特别是并行专业化,可以显着提高文化相关性,同时保持视觉质量和时间一致性。数据集和代码可在 https://github.com/AIM-SCU/MAVEN 获取