论文

MMCL-Bench:从视觉规则、程序和证据中进行多模态上下文学习

MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence

模型评测基准与评测资源

摘要

我们引入了 MMCL-Bench,这是多模态情境学习的基准:从视觉或混合模态教学情境中学习任务局部规则、程序和经验模式,并将其应用于新的视觉实例。与纯文本上下文学习或标准多模态问答不同,此设置要求模型从图像、屏幕截图、手册、视频和帧序列中恢复和定位相关证据,然后才能对学习到的上下文进行推理。 MMCL-Bench 包含 102 个任务,涵盖三个类别:规则系统应用、程序任务执行以及经验发现和归纳。我们通过严格的基于规则的评分来评估前沿多模态模型,发现当前的系统距离强大的多模态上下文学习还很远,即使是最强的模型在严格评估下也只能解决不到三分之一的任务。诊断消融和错误分析表明,整个上下文到答案的流程都会出现故障,包括上下文锚定、视觉证据提取、上下文推理和响应构建。因此,MMCL-Bench 强调多模态上下文学习是当前多模态模型未解决的重要能力瓶颈。