论文

文本到图像模型可以从正确的参考系中绘制吗?

Can Text-to-Image Models Draw from the Right Frame of Reference?

模型评测基准与评测资源

摘要

空间指令跟踪已成为文本到图像(T2I)生成的关键要求。当在不同的参考系下解释方向表达式时,会出现一个常见的挑战。例如,“左侧”可能指的是观看者的图像坐标或对象的固有方向,从而导致不同的预期布局。现有的 T2I 基准测试揭示了重要的布局失败,但它们很少隔离模型在与相机视图不同时是否可以遵循指定的参考系。为了缩小这一差距,我们引入了 FoR-T2I,这是一个通过受控空间布局构建的 1,200 个提示对来评估这种区别的基准。在每一对中,摄像机视图 (Cam) 提示说明摄像机视图中的目标关系,而参考框架 (FoR) 提示则通过定向锚点对象描述相同的目标位置。在 22 个闭源和开源 T2I 模型中,FoR 提示的平均最终准确度比匹配的 Cam 提示低 41.8%;即使是性能最好的模型,FoR 准确率也仅为 44.3%。这表明,当通过对象的方向而不是直接在图像坐标中描述相同的布局时,当前模型会更加困难。我们通过关系类型和摄像机视图进一步分析了这一差距,比较了几种 无需训练 提示和基于反馈的缓解策略,并提出了一种 VLM 门控重写方法,该方法使用视觉反馈选择重写的提示,在相同的生成预算下将平均 FoR 准确率从 25.0% 提高到 29.2%。