论文
HAS:多模态的亮点引导注意力引导 LLM 视频摘要
HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization
摘要
随着视频生成人工智能 (AI) 的发展,视频理解变得越来越重要。近日,Multimodal 大语言模型(M-LLM)展现了其在视频理解方面的能力。视频摘要是视频理解的一个特定领域,已证明其对于高效导航和检索的重要性。视频理解和视频摘要都需要对视频中的关键帧进行良好的选择。当前的视频摘要方法主要关注所选关键帧和相关片段描述。然而,现有的方法忽视了在全球范围内处理框架重要性的观点。我们认为,使用离散选定的帧进行摘要不仅会降低理解的一致性,还会丢失视频中的重要信息,并且浪费 MLLM 的原始容量。在本文中,我们提出了 HAS,一种用于视频摘要的高光引导注意力引导方法。我们考虑一个具有挑战性但实用的设置,其中提供给 MLLM 进行总结的视频应该是连续的,但有重点指导。 HAS主要由两部分组成:第一部分是在全局范围内找到视频的连续帧级高光分布。第二部分是将高亮分布作为 MLLM 的注意力引导向量,旨在更好地理解视频,从而在模型推理期间,将更多注意力放在高亮帧上,同时通过减少注意力而不是忘记它们来避免丢失不太高亮帧的全部信息。我们在各种基准上评估了 HAS,它在视频摘要方面表现出了令人信服的性能。