论文
阅读比您所看到的更多的内容:强化学习以生成准确且连贯的音频描述
READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations
摘要
音频描述旨在为盲人和弱视观众生成视听媒体中基本视觉内容的简明叙述。现有的方法要么依赖于提示现成的多模态模型,这通常与 AD 风格不匹配,要么通过下一个词元预测部分优化基于训练的系统,这对模型容量的探索不足并使生成偏向通用表达式。我们提出了 READ,这是第一个用于基于训练的 AD 生成的强化学习 (RL) 框架。 READ 将 AD 制定为具有参考匹配、长度和格式奖励的序列级优化,并进一步在上下文感知监督下引入专用的连贯性奖励,以促进叙述连贯的描述。 MAD-Eval、CMD-AD 和 TV-AD 上的实验表明,READ 在各种评估指标上都明显优于先前的方法。我们的结果强调强化学习是一种有前景的准确、连贯的 AD 生成范例。我们的代码、模型和基准测试结果将公开。