论文

TwinICL:通过配对反事实诊断多模式情境学习

TwinICL: Diagnosing Multimodal In-Context Learning through Paired Counterfactuals

模型评测基准与评测资源

摘要

上下文学习 (ICL) 使模型能够从演示中推断任务,但现有基准通常缺乏比较跨模式的 ICL 性能所需的匹配文本和图像版本。我们引入了 TwinICL,这是一种程序生成的基准,提供此类对进行受控比较。在 6 个开放权重模型和 38 个任务中,多模式 ICL 的表现始终低于纯文本 ICL,差距因任务系列而异。为了测试这种差距是否可以弥补,我们通过三种干预措施针对视觉访问、任务框架和推理。尽管个体效应有限或不一致,但它们的组合在诊断子集上恢复了强大的多模式 ICL 性能。为了区分执行任务和推断任务的困难,我们使用明确的任务指令评估模型,即使任务已知,也能揭示模态差距。然后,我们研究添加演示输入和输出如何重塑这一差距,强调演示作为过程的附加背景和任务证据的双重作用。该数据集可在 https://github.com/lab-flair/TwinICL 获取。