论文
REFRAMED:为电影生成逼真的音频描述
REFRAMED: Towards Realistic Audio Description Generation for Movies
摘要
音频描述 (AD) 是对视频中关键视觉内容的口头叙述,方便视障观众观看。与标准视频字幕不同,广告是一项结构化的编辑任务:描述必须插入对话的间隙中,并且必须仅传达理解所讲述的叙述所需的内容。然而,现有的方法在人工设置中制定广告生成,其中描述的内容和时间都是预先指定的,从而将任务减少到剪辑级字幕。它们进一步依赖于嘈杂的转录和对齐管道,并且缺乏建模叙事上下文所需的丰富并行数据。我们引入了 AD 生成的新公式,其中模型必须共同决定描述什么以及何时描述。为了支持这一点,我们推出了 REFRAMED,这是一个包含 2,023 个视频的高质量数据集,涵盖 206 部电影的 3,302 个场景,并配有专业的 AD 脚本(美国和英国版本)、专业字幕和对齐的剧本。我们还提供了一个手动策划的挑战集,将完整的电影与多个 AD 参考配对,以及利用对话间隙和多参考比较的评估协议。使用最先进的 AD 系统和多模式 LLM 进行的实验表明,它们的表现优于普通基线,但远远低于人类专家的表现。我们的数据集和基准为视频理解研究奠定了新的基础。