论文
利用 MLLM 对多视频摘要中的位置偏差进行系统评估
A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs
摘要
多模态 大语言模型 (MLLM) 越来越多地用于视频理解,但其在多视频输入下的可靠性仍然知之甚少。我们研究多视频摘要中的位置偏差,其中每个视频摘要的质量可能会随着视频的输入槽而变化,即使底层内容不变。我们根据 ActivityNet 和新闻视频构建了一个基准,涵盖具有两个和四个视频输入的烹饪、家庭、休闲和新闻设置。我们评估了九个开源和专有的 MLLM,并使用三个互补指标来衡量位置效应:覆盖范围、方向位置偏差 (DPB) 和中边缘差距 (MEG)。我们的结果表明,位置效应与领域和模型相关:即使中间位置表现不佳,符号方向偏差也可能很小,并且增加视觉或生成预算并不能统一消除不平衡。我们进一步分析即时级别的缓解方法。总之,结果表明,多视频摘要仍然对输入协议和位置敏感,从而激发了更强大的顺序不变多模态系统。