论文
Video2Reaction:将视频映射到野外观众反应分布
Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild
摘要
了解和预测观众对视频内容的反应对于改进内容创建、推荐系统和媒体分析至关重要。为了实现观众反应预测和其他内容参与应用,我们引入了$\textbf{Video2Reaction}$,这是一个多模式数据集,它将短片片段映射到通过社交媒体表达的观众的$\textit{诱导情绪}$分布。 $\textbf{Video2Reaction}$ 涵盖 10,000 多个视频,可作为可靠的基准以及观众反应预测的训练资源。为了在反应可能随时间变化的情况下实现经济高效的连续注释,我们仅使用开源 LLM 开发了一个两阶段多代理管道,尽管任务本身具有噪声和主观性质,但在人工盲验证下实现了 86% 的正确性。我们为野外视频到反应分布预测建立了第一个基准,并表明预训练的基础视频模型在零样本设置中失败,而微调将它们转变为最先进的预测器,能够仅对视频的完整反应分布和主要反应进行建模。然而,这项任务仍然具有挑战性:即使是最强大的方法,在主导反应预测 (LLaVA-Next) 中也只能达到 77% 的 Top-3 F1,这凸显了在模拟观众集体反应方面存在巨大差距。 \modification{数据集和代码可在我们的项目页面获取:https://information-fusion-lab-umass.github.io/video2reaction-bench.github.io