计划,而不是解码器:诊断和修复推理增强文本到图像生成中的组合故障
The Plan, Not the Decoder: Diagnosing and Repairing Compositional Failure in Reasoning-Augmented Text-to-Image Generation
摘要
推理增强文本到图像模型(例如 GoT-R1)会在生成图像标记之前发出明确的文本计划 - 对象名称、属性和边界框。当这样的模型在组合提示中失败时,是计划错误,还是计划正确而解码器不忠实?由于该计划是机器可读的,因此可以在解码之前对其进行编辑,这使得两者可以分离。我们首先验证标尺。在模型自己的链内交换两个边界框显然会翻转生成的布局:基于检测器的精度下降 0.75 -> 0.48 (p<1e-3),而广泛使用的基于 VQA 的空间度量则上升。一项由五位评估者进行的人类研究在 81% 的项目上与检测器一致,在 57% 的项目上与 VQA 法官一致。因此,所有空间结果都使用几何评分。在声音测量下,解码器是忠实的执行者:94%的生成布局实现了计划的关系,并且对象框绑定在计划的对象段重新排序后仍然存在。计划者是瓶颈。它会因为与措辞相关的原因而写出错误的关系——对于语义相同的布局,“左”的准确度为 98%,“右”的准确度为 54%,我们通过提及顺序控制来隔离光栅顺序偏差——以及解码器忠实再现的混乱的几何形状。因此,编辑计划无需重新训练即可修复图像:重采样的符号验证给出 +5.0 点 (p<1e-3),最小就地修复 +6.0 (p=.02),仅重写框几何 +10.7 (p<1e-4),并彻底替换计划 +13.3 (p=1e-4)。收益与计划的散文风格及其在计划者之下的可能性无关,但与其几何形状无关。因此,只要计划内部一致,模块化规划器-解码器设计就是可行的:框文本矛盾会导致对象重复和身份融合。我们发布了计划保真度评估协议、所有计划和 12k 生成的图像。