论文
什么时候任务向量就足够了?隐式多模态 ICL 的实证理论
When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL
摘要
隐式多模态上下文学习将演示压缩为内部干预,范围从静态任务向量到查询条件转换和注意力路由。尽管它们有共同的目标,但这些方法在干预如何依赖于查询以及在何处修改模型方面存在很大差异,从而不清楚给定任务需要哪些额外的复杂性。我们提出选择-实现假说。它将演示视为引发查询从中选择的一系列紧凑的内部更改,而模型的计算限制了如何实现所选更改。我们使用受控多模式任务来评估此帐户,其中查询依赖性会发生变化,而无需更改底层任务原语或提示格式。通过将正确的演示与匹配的反事实进行对比,我们测量了显式 M-ICL 的结构并测试它是否可以预测干预行为。我们发现静态任务向量的成功与演示引起的更改在查询之间共享的程度密切相关。当显式 M-ICL 包含局部加性移位无法恢复的查询特定或分布式结构时,额外的干预复杂性变得有用。这些关系扩展到自然 VQA 基准,并支持成本感知方法选择,而无需访问测试性能。我们的结果提供了一个统一的经验理论,说明何时可以将演示压缩为任务向量以及何时需要更具表现力的干预。