论文

VEGAS:通过凝视进行人眼对齐视频视频描述评估

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

模型评测评测方法与指标

摘要

视觉语言模型擅长视频视频描述,但通常生成的描述无法吸引个别观众的注意力。我们提出 VEGAS(通过凝视分数进行视频视频描述评估),这是一种 无需训练 指标,利用测试时凝视来采样个性化的、注意力一致的文本。它是一种跨模式的信息论度量,可量化候选视频描述与观看者焦点的匹配程度。为了评估 VEGAS,我们整理了一个以自我为中心的活动和教学幻灯片的数据集,并配有同步凝视和参考注释。然后,我们通过拒绝采样来选择基于 VEGAS 的视频描述,无需模型重新训练。实验表明,VEGAS 选择的视频描述明显更好地符合人类焦点,并改善了下游视频描述到视频的检索,证明了在推理过程中纳入观看者注意力的实用性。