论文
MMOOC:多模态脱离上下文评估的综合基准 大语言模型
MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models
摘要
多模态 大语言模型 (MLLM) 在广泛的视觉语言任务上取得了出色的性能,但在不完美或转移的环境下经常失败。可靠的 MLLM 应该拒绝具有主题级别上下文转换的真正脱离上下文 (OOC) 的问题,同时仍然回答具有非主题上下文转换的上下文转换 (Shifted IC) 问题。现有基准主要针对 OOC 或视觉上无法回答的问题,但忽略了可回答的 Shifted IC 案例并涵盖有限的 OOC 转变。为了填补这一空白,我们提出了 MMOOC,这是一个用于评估 MLLM 的拒绝和稳健回答能力的大规模基准。 MMOOC 包含超过 41K 个图像问题对,包括可回答的 Shifted IC 案例和不可回答的 OOC 案例,涵盖三种问题格式、八种轮班类型和六种视觉场景,并通过基于 MLLM 的过滤和人工验证来确保数据质量。我们使用准确度和拒绝率来评估模型响应,并进一步引入 LLM-as-a-Judge 指标来评估模型推理的正确性。对不同 MLLM 的实验表明,当前模型仍然难以在变化的环境下平衡回答能力和拒绝能力。我们进一步分析了关键故障模式,并表明 后训练 可以提高鲁棒性。 MMOOC 将公开提供。