论文
Video2Reaction:训练基础视频模型以预测观众反应
Video2Reaction: Training Foundation Video Models to Predict Audience Reaction
摘要
我们引入了 Video2Reaction,这是一个多模式数据集,它将短片片段映射到通过社交媒体评论表达的野外观众诱发的情绪反应。 Video2Reaction 通过大规模聚合在线评论的反应,将标签建模为分类情感的分布,以更好地反映情感感知的主观性和模糊性,从而捕获情感反应的自然多样性。我们对使用 LoRA 进行微调的两种视觉语言模型 (VLM) 进行了基准测试,结果表明 VLM 可有效地从 Video2Reaction 中学习,并且在主导反应预测方面优于专门的基线。我们进一步证明,在 Video2Reaction 上预微调的 VLM 可以有效地转移到 VCE,这是另一个具有不同分类和视频域的诱导情感数据集。值得注意的是,LLaVA-NeXT-Video-7B 在 Video2Reaction 上进行了预微调,并仅对 1% 的 VCE 训练数据进行了调整,实现了 0.682 的前 3 名准确率,与在完整数据集上训练的最佳报告 VCE 性能相当。该数据集可在 https://huggingface.co/datasets/infofusionlab/Video2Reaction 获取