论文

CLBench-V:评估从基础到知识获取的多模态情境学习

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

模型评测基准与评测资源

摘要

现实世界的任务通常需要模型从特定于任务的上下文中学习,而不是仅仅依赖于预先训练的知识。虽然最近的工作强调了这种能力作为上下文学习,但现有的评估主要集中在文本上下文上。然而,在许多实际环境中,要学习的背景是多模式的:科学发现通过图形和表格传达,财务指标分散在转换后的报告中,空间决策取决于地图、场景或网页。我们引入了 CLBench-V,这是多模态情境学习的基准,它通过围绕三个维度组织任务来解决定位情境使用故障的困难:情境基础、新信息应用和新知识学习。 CLBench-V 将转换后的公共基准与跨越科学、金融、长文档理解、空间推理和基于网络的视觉问答等领域的新构建的数据集相结合。为了降低构建特定领域的上下文学习任务的成本,我们进一步对新构建的数据集使用自动化构建和过滤程序。在 3,443 个实例和最近的 6 个多模态模型中,最佳总体得分仅为 0.2847,表明多模态上下文学习仍远未饱和。此外,InternVL3.5-30B-A3B在情境基础和新知识学习方面表现最佳,而Qwen3.5-Plus在新信息应用方面表现最佳。我们进一步分析判断可靠性、上下文长度、图像计数和代表性失败案例。代码可在 https://github.com/IamLihua/CLBench-V 获取。