论文
当无答案是正确答案:诊断MLLM在视频理解中的缺失答案检测
When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding
摘要
多模态大语言模型(MLLM)在视频理解方面取得了实质性进展,但其响应的可靠性仍未得到充分探索。这项工作提出了视频理解中 MLLM 缺失答案检测的诊断研究,其中正确答案被故意从候选集中排除,并且可靠的模型有望识别不存在有效选项。我们在三种设置下评估缺席答案检测行为:用“以上都不是”选项增强的多项选择题、带有检测指令的开放式生成以及没有任何指导的标准评估。在一系列不同的模型和基准中,我们发现 MLLM 绝大多数会选择看似合理的干扰项,而不是检测缺失的答案。这种失败在时间推理任务中更为明显,并且随着帧采样的密集而恶化。我们进一步探索了思想链提示作为一种缓解策略,发现虽然它大大提高了检测率,但性能仍然不能令人满意,这表明仅基于提示的策略不足以完全解决这一限制。这些发现暴露了缺席答案检测的系统性失败,并强调了多模态系统中明确检测机制的必要性。
