论文
ViMU:视频隐喻理解基准测试
ViMU: Benchmarking Video Metaphorical Understanding
摘要
任何新媒体一旦出现,其用途就不仅仅是传输公开内容。它所承载的信息通常在两个层面上运作:一是直接呈现的内容,二是其背后的潜台词——创作者试图通过媒介传达的隐含的想法和意图。同样,自从视频技术被广泛采用以来,视频不仅成为记录和交流视觉信息的强大工具,而且成为表达情感、态度和社会意义的载体,而这些情感、态度和社会意义往往难以明确表达。因此,许多视频的真正含义不仅仅在于屏幕上显示的内容;还在于其内容。它通常嵌入上下文、表达风格和观看者的社交体验中。此类视频潜台词的某些形式是幽默的,而另一些则带有讽刺、嘲笑或批评。这些隐含的含义在不同的文化背景和社会群体中也可以有非常不同的解释。然而,大多数现有的视频理解模型仍然主要关注字面视觉理解,例如识别物体、动作或时间关系,缺乏系统地理解视频中隐喻、讽刺和社会意义的能力。为了弥补这一差距,我们引入了 ViMU,这是第一个旨在系统评估视频中前沿模型的潜台词理解能力的基准测试。 ViMU 评估视频理解模型是否可以超越字面感知来推断隐含含义,同时将其解释建立在多模态证据的基础上,并回答开放式问题和多项选择问题。重要的是,所有问题都设计为无提示,确保在回答之前不会向模型透露任何关键证据。