论文
NegT2IBench:否定改变画面
NegT2IBench: When Negation Changes the Picture. A Polarity Benchmark for Text-to-Image Models
摘要
文生图(T2I)模型由测"所请求内容是否出现"的基准评判,但这些基准大多忽视满足否定约束的互补能力——例如生成"一个非红色的杯子"。度量否定带来肯定式基准没有的挑战,需要仔细的提示与评估设计。我们提出NegT2IBench:覆盖两种属性类型与四种关系类别的4800提示基准。提示按极性组织:必须成立的肯定陈述数与必须不成立的否定陈述数各取0到2;独立变化两者可分离否定效应与提示复杂度效应。我们的检测器打分可复现、可审计并精确定位哪个要求失败;在600张三标注者图像上与人类的一致性堪比大至30倍的视觉语言裁判,而GPU内存仅为其零头。跨十一个T2I模型与211200张图像,九个模型在单个否定陈述上的得分低于单个肯定陈述。逐语句打分揭示:颜色损失最大、邻近接近零,且41.5%的失败语句恰好渲染了提示禁止的内容。渲染要求的内容与扣留禁止的内容是聚合组合分无法区分的两种能力;NegT2IBench直接度量后者,为诊断否定失败并开发克服方法提供受控试验床。