论文

GRACE:通过有视觉依据的动作证据来增强视频 MLLM,以预测观众情绪

GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction

上下文与知识上下文工程

摘要

视频广告中的观众情绪预测旨在推断观众所引起的潜在情感反应。为了弥合所显示内容和所感受到内容之间的差距,模型必须从明确的视觉叙事、具体的角色与对象交互和可见的文本线索中推断出隐藏的观看者情绪。然而,标准多模态 大语言模型 (MLLM) 通常依赖于整体框架表示,这使得这些细粒度的、与情感相关的事件变得隐含,并使精确的情感推理变得复杂。为了解决这个问题,我们提出了一个以行动为中心的证据增强框架,通过引入明确的事件结构和局部视觉证据来增强视频 MLLM 的线索提取和理解。我们的方法从以动作为中心的视频描述中提取时间顺序的主谓宾 (SVO) 三元组和辅助可见文本线索,将主语和客体实体作为视觉实体作物,然后使 MLLM 能够基于这些提取的结构化线索执行线索增强的情感推理。通过这种方式,动作三元组指定“发生了什么”,而已定位视觉实体裁剪图将“谁或什么参与每个事件”锚定到具体的视觉证据。 Pitts 数据集上的实验显示相对于 Qwen2.5-VL 和 Qwen3-VL 基线的一致改进。消融研究、AdsQA 的跨数据集评估以及以情感为中心的 TVQA 子集的转移实验进一步支持了我们方法的有效性和泛化性。