论文
FORGE:用于长格式视频理解的相关几何中的帧正交性
FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding
摘要
多模态 大语言模型 (MLLM) 能够以前所未有的规模实现长格式视频理解。然而,随着视频序列长度的增加,相关内容的密度急剧下降,并且将模型暴露于更多不相关的内容会显着降低其准确性。在本文中,我们解决了在推理时选择的帧子集中最大化查询相关信息的问题,无需训练。 FORGE(相关几何中的框架正交性)是一种与模型无关的方法,可在预训练的多模态嵌入空间上引入查询条件几何,将相关性和多样性统一到单个目标中。在这个空间中,覆盖独立的查询相关方向的框架相距很远,并且选择最大信息的子集可以在预算内捕获不同的查询相关内容。在 Video-MME 和 LongVideoBench 上以 16、32 和 64 帧预算进行的实验表明,与最强的 无需训练 基线相比,FORGE 将统一关键帧选择分数提高了 11.0-15.3 分,并且关键帧召回率提高了一倍(Video-MME 上 K=64 时为 0.415 vs. 0.204)。这种收益延伸到了问答领域,在跨越 4B 至 32B 参数的 8 个开源 MLLM 的每个评估设置中,准确性均得到提高,比均匀采样提高了 8.7 点,比最强基线提高了 5.2 点。我们的研究结果表明,将嵌入空间与查询的高维结构对齐是推理时视频理解的一个有前途的方向。