论文
COMPASS:拆开组合推理与单项技能负载
Diagnosing the Sources of Compositional Failure in Vision-Language Models: A Controlled Analysis
摘要
视觉语言模型(VLM)经常难以完成组合推理任务,但表现不佳的原因仍不清楚。一个常见的假设是模型难以整合多个组件,导致需要进行训练干预来改善成分结合。然而,这一假设从未被直接量化。现有的基准仅以组合形式评估描述文本,因此无法将联合推理的成本与在负载增加的情况下识别单个组件的成本分开。我们引入了 COMPASS(技能组合分析),这是一个受控评估框架,旨在隔离和测量构成组合失败的不同因素。通过比较组合描述文本和分解描述文本的性能,我们直接量化了 87K 图像描述文本对的组合集成成本。在多个 VLM 中,这种差距是真实存在的,但却是部分的,仅占观察到的退化的一部分。这激发了对哪些其他因素控制模型行为的更细粒度的调查。我们使用跨 274K 图像描述文本对的技能目标扰动来分析单项技能层面的表现:对象检测、属性绑定和关系推理。我们发现了一致的技能特定模式:每种技能主要随着其自身基元类型(同类负载)的计数而降级,而交叉负载效应主要是积极的,这表明不同类型的基元提供了有用的基础上下文。这种模式适用于标准对比编码器、显式训练的组合推理模型和非对比架构。这些发现表明,成分退化反映了多个可分离的因素,这些因素不能单独归结为联合推理。
