论文
VidMsg:短视频中隐式消息推断的基准
VidMsg: A Benchmark for Implicit Message Inference in Short Videos
摘要
理解在线短视频不仅仅涉及识别可见的物体和动作;视频制作者通常会在剪辑中包含潜在的信息或目的。我们引入了 VidMsg,这是一个评估互联网原生视频剪辑中隐式消息理解的基准。 VidMsg 包含 400 个源自 YouTube 的剪辑,涉及 9 个实用主题领域和 52 条细粒度的目标消息,涵盖职业和金融、教育、健康和福祉、文化、安全、可持续发展和生活方式等领域。 VidMsg 是通过消息优先管道构建的:LLM 首先将目标消息转换为间接搜索场景,用于检索候选剪辑。然后,人工注释者会保留传达预期信息但又不会过于明确的剪辑。 VidMsg 主要设计用于可扩展应用程序的双向消息剪辑检索,例如视频搜索和推荐,其中系统必须捕获整体视频理解。除了检索之外,VidMsg 还包括一个诊断性多项选择 QA 基准,其中模型从语义相关的替代方案中选择剪辑的预期消息。对当代视频语言和检索模型的实验表明,强大的模型常常在 VidMsg 上失败,因为该任务需要语用推理、上下文线索的整合以及语义上接近的消息之间的区分。我们还引入了 VidVec-Msg,这是一种基线方法,可以改进面向消息的检索,同时为未来的工作留出大量空间。