StrAD:长视频音频描述生成的流媒体方法和基准
StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos
摘要
视觉内容是主要的交流媒介,但如果没有音频描述 (AD),盲人和弱视人士仍然无法访问它。广告在自然音频暂停期间叙述与上下文相关的视觉事件。手动创建 AD 的成本很高,且覆盖范围仅限于一小部分可用内容。大多数现有的自动 AD 生成方法将任务设计为视频剪辑字幕,需要 真值 时间戳和其他上下文提示(例如字符数据库)。当前的基准强化了这种框架,由短视频片段与自动或任务不匹配的注释配对组成。我们推出了 StrAD,这是针对电影、纪录片、短片、表演和视频游戏等不同类型的长视频生成长篇广告的基准。我们将广告生成重新定义为流式密集视频字幕。我们的方法使用滑动窗口处理完整长度的视频,将广告插入到没有 真值 时间戳的现有记录中,并支持微调模型和视觉语言模型的零样本提示。在给定时间戳的分段级任务上,我们经过微调的 StrAD-FT 在 CMD-AD 上以 36.3 CIDEr(比逐镜头 +10.0)设定了最先进的水平,在 StrAD (51.0 CIDEr) 上建立了参考点,并在 MAD-Eval 上保持了 24.9 CIDEr 的竞争力。在全视频流任务中,StrAD-FT 的 SODA 得分为 2.4,而我们的零样本基线 StrAD-Zero 为 1.1,尽管两者在时间定位和叙事连贯性方面都表现出局限性。虽然之前的工作以离线、多阶段的方式解决了全视频广告生成问题,但我们的工作是第一个流式处理方法,可以动态生成广告,而无需 真值 时间戳。 StrAD 在全视频广告生成方面取得了可衡量的进展,这是扩展可访问性的先决条件。