论文
MEDR:通过多信号事件建模和动态重新评分进行独立于查询的帧选择
MEDR: Query-Independent Frame Selection via Multi-Signal Event Modeling and Dynamic Rescoring
摘要
帧选择是多模态 大语言模型 的基本组成部分,使长视频能够在有限的视觉词元和计算预算下进行处理。均匀采样保留了时间覆盖范围,但可能会错过仅短暂出现的信息内容。为了减轻这种限制,依赖于查询的方法可以检索与问题相关的框架。然而,由于所选帧取决于当前问题,因此不同问题之间无法直接共享相同的视觉输入,并且在多轮视频对话中必须重复帧选择。这促使我们寻求一种独立于查询的帧选择方法,该方法保留固定视觉输入的可重用性,同时提高信息事件的覆盖范围,超越统一采样。我们提出了多信号事件建模和动态重新评分(MEDR),一种 无需训练 和独立于查询的帧选择方法。多信号事件建模将互补的视觉、运动和文本信号组织成特定于信号的时间事件。然后,动态重新评分相对于当前选定的集合迭代地重新评估每个候选者,根据帧级信号强度、附加事件覆盖范围和时间接近度更新其分数。生成的固定框架集是在不观察查询的情况下构建的,并且可以在不同的问题中重复使用。在标准基准评估中,MEDR 在 Video-MME 上将模型精度提高了 0.63%-0.89%。在 LongVideoBench 的长视频子集上,Qwen3-VL-8B 将准确率提高了 1.23%。 MEDR 将整体准确率进一步提高了 0.53%,同时针对有关视频的每个问题重复使用完全相同的帧集。