论文

StoryTeller:无需训练 长篇音频描述的叙事与视觉证据对齐

StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description

摘要

长篇音频描述 (AD) 需要的不仅仅是描述可见的动作:它必须保留各个场景中的人物、事件、关系和故事背景,以便盲人和弱视 (BLV) 观众能够观看电影。现代视频语言模型 (VLM) 对于短片非常有效,但它们通常独立处理每个时刻,产生的描述会忽略角色是谁、事件为何重要以及当前场景如何与早期叙事上下文联系起来。我们提出 StoryTeller,这是一个用于故事感知长格式 AD 的 无需训练 框架。 StoryTeller 不只依赖局部视觉线索,而是保留经过验证的叙事记忆,在各个场景中传递与故事相关的信息,使后续的描述保持连贯、有视觉依据且包含充分上下文信息。仅给定原始视频和电影标题,StoryTeller 可以选择检索公共电影元数据来解析名称和故事上下文,同时通过语义过滤和 VLM 验证仅接受视频支持的事实。该方法不需要字幕、脚本、AD 转录本、对齐字幕、字符库、预先计算的面部身份或特定于任务的 微调。为了评估生成的 AD 是否保留了叙述信息,我们引入了 StoryAD-QA,这是一种问答基准,用于测试语言模型是否可以仅使用生成的描述来回答故事上下文问题。标准 AD 基准和各种长视频的实验表明,与自动、基于 QA 和人工评估的强大基线相比,StoryTeller 不断提高叙述连贯性、事实基础和故事理解。