论文

总是 10:10:参考图像打破了仅提示凹痕的偏见

It's Always 10:10: Reference Images Break a Bias That Prompts Only Dent

模型评测模型行为与机制分析

摘要

文本到图像模型似乎重现了他们从照片中学到的习惯。模拟时钟是一个极端的例子:在广告中,手表几乎总是显示 10:10,即使请求另一个时间,生成的时钟也会返回到 10:10。我们测量了这种偏差,并在 Magnific 平台上的 52 个模型上测试了克服这种偏差的三种方法,并在 Higgsfield 上进行了复制。每个图像显示三个相同的时钟,必须显示 2:35、6:50 和 11:20。对象的描述是固定的,只有关于时间的请求发生变化:没有时间(A),以数字表示的时间(B),通过相对于表盘数字的结构描述的指针位置(C),或相同的描述加上绘制的参考表盘(D)。两名 AI 阅读器从编码副本中盲读全部 1,799 张图像,第三名阅读器和作者解决分歧(表盘级别一致性 96.0% 和 97.3%)。在没有时间要求的情况下,67% 的图像的所有三个时钟均为 10:10。在 20 个当前型号中,所有三个时钟在包含数字的图像中的正确率为 34%,在用文字描述的指针图像中为 30%,在用文字描述的图像中为 75%。 参考刻度盘(D-B:+37 点,95% CI +28 至 +45);我们没有发现任何证据表明用文字描述手比用数字描述手(C-B:-4分,CI -10到+1)。两个平台共享的 12 个模型的复制给出了相同的情况(B 54%、C 50%、D 81%)。写入时间可以减少偏差,但 20 个当前模型的三分之二的图像至少有一个错误的时钟;添加绘制参考可将完全准确度提高到四分之三,并且几乎完全消除 10:10 处的图像。我们发布所有图像、提示、原始读数以及重新计算每个结果的脚本。