论文
注意差距:诊断图像中文本编辑中的约束发现失败
Mind the Gap: Diagnosing Constraint Discovery Failures in Text-in-Image Editing
摘要
多模态推理的一个关键挑战是确定哪些视觉依赖关系在特定任务下变得相关,而不仅仅是识别可见内容。我们通过图像中文本编辑中的编辑诱导约束发现来研究这一点,这是一种受控诊断设置,其中本地文本更改可以激活二级一致性约束:给定有效的编辑指令和图像,模型能否识别也必须更改的二级区域?在 461 个诊断案例、4 个 MLLM 和 19 个约束子类型中,模型在无指导提示下仅恢复了 46% 的案例级宏观回忆,而在明确提供约束时则为 94%,这表明当模型必须决定要显示哪些未声明的依赖关系时,会出现很大一部分失败。预言字段分解表明,特定于案例的因果解释是最有效的部分指导(召回率为 0.782),高于区域名称(0.610)或类型标签(0.646),这表明特定于编辑的因果线索占了预言增益的大部分。下游实验进一步表明,较高的自我发现召回率并不一定会提高任务绩效:未经验证的自我发现会引入误报,从而抵消召回率的增益,从而激发精确感知的约束启发。