论文

FORTE:长视频问答的自适应评分和精确关键帧选择

FORTE: Adaptive Scoring and Exact Keyframe Selection for Long-Video Question Answering

上下文与知识上下文工程

摘要

查询感知关键帧选择使多模态大语言模型 (MLLM) 能够仅使用一小组与问题相关的帧来处理长视频。然而,现有的基于分数的方法通常在固定的、均匀采样的候选池内进行搜索,从而防止选择该池之外的证据。鉴于相关性评分预算有限,关键的挑战是在继续探索代表性不足的时间区域的同时,将评估自适应地分配给有希望的框架。我们引入了 FORTE,这是一个免训练框架,通过两个阶段解决这一挑战:自适应相关性评分和全局关键帧优化。从稀疏、均匀分布的观测开始,我们高效的高斯过程相关性预测器估计未评分帧的相关性,利用时间局部性和近似带状内核结构,将固定带宽帧数的核心计算从立方时间减少到线性时间。然后,评分阶段通过平衡预测的相关性与时间覆盖范围来选择接下来要评分的帧,优先考虑有希望的区域,同时探索视频中较少代表的部分。优化阶段通过最大化联合捕获测量的相关性和时间覆盖范围的目标来选择最终关键帧。我们推导出一种精确的算法,该算法利用对数覆盖结构来识别与池大小呈线性时间关系的评分候选池的最佳子集,以获得固定的最终帧预算。对四个长视频问答基准的实验表明,在每个测试的评分预算下,FORTE 在比较选择器中实现了最高的观察到的平均准确度。进一步的评估证明了其在不同相关性评分者和下游 MLLM 中的一致有效性。