论文
什么、何时以及如何:作为受限全局优化的音频描述
What, When, and How: Audio Description as Constrained Global Optimization
摘要
音频描述 (AD) 通过在对话间隙叙述视觉信息,使盲人和视障观众能够观看电影。现有的自动 AD 系统在很大程度上将生成视为本地视频到文本的问题,假设已经提供了要描述的内容及其时间位置。相反,现实广告需要做出一些决策,包括哪些视觉信息具有叙事重要性、何时可以在不干扰对话的情况下说出视觉信息,以及如何在可用时间内制定视觉信息。我们将 AD 生成形式化为这三个决策的约束优化问题。我们的混合系统使用大型语言模型来提出和基础视觉元素,估计它们对叙述的显着性,并生成压缩的实现。然后,混合整数线性程序在受时间约束的情况下联合选择和安排整个场景的描述。当在 REFRAMED(电影真实广告基准)上进行评估时,我们的方法比提示大语言模型关于描述什么以及何时描述它做出了更好的决策,从而在叙事 QA 和基于时间的指标上建立了新的 SOTA。消融表明,明确的时间限制推动了放置的收益,而显着性估计则控制了保留多少叙事上有用的内容。尽管与专业描述者之间仍然存在显着差距,但改进主要集中在时间和叙述性测量上,而不是 n-gram 重叠上。