论文

从视觉提示到口头叙述:重新思考音频描述

From Visual Cues to Spoken Narration: Rethinking Audio Description

应用与实践内容创作

摘要

音频描述 (AD) 在对话间隙提供视觉事件的口头叙述,使视障观众可以观看电影。该问题需要确定叙述什么(哪个视觉事件)和何时(插入广告的位置),以实现最佳的用户体验。先前的工作在很大程度上减少了预分段视频剪辑的视频字幕问题,即什么内容基本上是预定义的,什么时候完全被忽略。我们提出了 Cue2Narrate,这是一个两阶段的管道,可以共同预测在较长的未修剪的电影剪辑中叙述什么以及何时叙述。双头视听定位器预测每个 AD 话语的两个时间上不同的窗口:视觉提示窗口和口头叙述窗口。然后,适应 LoRA 的 VLM 根据预测的视觉证据生成简明的 AD,并使用描述排名损失进行训练,将相同帧的字幕(负样本)排名低于 GT AD。为了对这个新问题陈述进行基准测试,我们引入了 LongLSMDC 基准测试,其中包含最多 8 分钟的影片剪辑(平均约 6.5 分钟)。在 LongLSMDC 上,Cue2Narrate 的平均性能优于纯视频和纯音频定位基线 5--12 个点。地图。在预测窗口和 GT 窗口评估下,Cue2Narrate 比相应的微调基础 VLM 改进了 AD 生成。这些结果为长片段上的多段广告生成建立了第一个基准。数据和代码:https://github.com/multimodal-ai-lab/Cue2Narrate