论文
MetaphorVU:迈向隐喻视频理解
MetaphorVU: Towards Metaphorical Video Understanding
摘要
隐喻视频在各种现实场景中普遍存在,用于传达复杂的想法,理解它们通常需要高阶认知能力。缺乏对隐喻视频理解的系统研究不仅限制了 MLLM 的现实应用性,而且阻碍了对其高阶认知能力的全面评估。为了弥补这一差距,我们提出了 MetaphorVU-Bench,这是第一个致力于隐喻视频理解的系统且全面的基准测试。通过实验,我们发现当前的 MLLM 难以准确理解隐喻视频,远远落后于人类水平,这主要是由于跨域映射存在缺陷。受这一发现的启发,我们构建了一个隐喻知识图作为映射增强,并提出了 MetaphorBoost,一种推理时间增强框架,实现了一致的性能改进。我们的基准、分析和方法为先进 MLLM 的未来研究提供了有用的见解和基础。