论文
RoadTones:从道路活动视频生成音调可控文本
RoadTones: Tone Controllable Text Generation from Road Event Videos
摘要
现有的视频语言模型可以生成道路事件的事实描述,但无法控制这些事件的表达方式:它们的语气、紧迫性或风格。这限制了在通信关键环境中的部署,在这些环境中,消息的有效性取决于内容和表示,而不仅仅是事实的准确性。为了缓解这个问题,我们引入了一个全面的数据集模型评估套件,用于音调可控的道路视频字幕。我们经过人工验证的数据生成管道通过不同的色调注释和多色调字幕扩展了道路视频语料库,生成了 RoadTones-51K 数据集。我们提出了 RoadTones-VL-CoT,这是一种可控的视频到文本模型,它还可以生成音调条件的思想链中间草稿以实现可解释性。我们还推出了 RoadTones-Eval,这是一个新的评估套件,可以联合衡量事实一致性和语气遵守情况。此外,我们还进行了一项用户研究,其结果验证了字幕质量、语气控制和事实一致性。这些贡献共同为上下文敏感的音调可控视频字幕奠定了基础。