论文

像人一样看电影:对具身同伴的以自我为中心的情感理解

Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

模型评测基准与评测资源

摘要

实体机器人代理通常通过以自我为中心的屏幕视图界面而不是本地电影镜头来感知电影,从而引入视点扭曲、比例变化、照明变化和环境干扰等域变化。然而,现有的电影情感理解研究几乎全部针对电影片段进行,限制了对现实世界观看场景的跨领域推广。为了弥补这一差距,我们引入了 EgoScreen-Emotion (ESE),这是第一个用于以自我为中心的屏幕观看电影情感理解的基准数据集。 ESE 包含在受控的以自我为中心的屏幕视图条件下捕获的 224 个电影预告片,生成 28,667 个时间对齐的关键帧,由多个评分者使用信任感知的多标签协议进行注释,以解决情感模糊性。我们进一步构建了一个多模态长上下文情感推理框架,该框架对时间视觉证据、叙述摘要、压缩历史上下文和音频线索进行建模。跨域实验揭示了严重的域差距:当根据现实的以自我为中心的屏幕视图观察进行评估时,在电影镜头上训练的模型从 27.99 下降到 16.69 Macro-F1。 ESE 训练极大地提高了真实观看条件下的鲁棒性。与强大的闭源多模态模型相比,我们的方法实现了具有竞争力的性能,突出了特定领域数据和长上下文多模态推理的重要性。