论文
文本到图像模型是归纳主义火鸡吗?因果推理的反事实基准
Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning
摘要
文本到图像(T2I)生成模型在根据自然语言提示生成视觉逼真的图像方面取得了显着进展。然而,目前尚不清楚他们的成功是否反映了真正的因果理解或对视觉文本相关性的复杂模式匹配。受罗素归纳主义火鸡的启发,我们引入了 Counterfactual-World (CF-World),这是一个反事实基准,旨在研究文本到图像模型是否可以在系统地与现实世界先验相矛盾的规则下生成图像。 CF-World将每个场景分为三个递进的级别:普通世界知识下的事实生成、具有直接视觉指令的显式反事实生成、以及需要从改变的规则中进行因果推论的隐式反事实生成。我们使用基于视觉语言模型 (VLM) 的评估器 (CF-Eval) 评估开源和闭源 T2I 模型。此外,我们引入了两个指标:先验阻力率(PRR),它衡量模型克服根深蒂固的现实世界先验的能力;推理保留率(RRR),它评估模型是否可以在没有明确视觉提示的情况下维持推理依赖的反事实生成。实验表明,所有模型都表现出从事实设置到反事实设置的急剧退化。进一步的分析表明,这些失败的出现是因为当前的 T2I 模型将世界知识和视觉外观编码为紧密耦合的模式。因此,他们对训练数据中频繁视觉共现的严重依赖迫使他们在渲染反事实世界的任务时默认使用熟悉的常识先验。