论文

当评审行动时:根据文化情境提示审核 VLM 引导的图像选择

When the Judge Acts: Auditing VLM-Guided Image Selection on Culturally Situated Prompts

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 越来越多地充当评审,从生成的多个图像中选择最好的图像,因此它们的选择决定了用户看到的内容。这些评委通常通过评分与人类评分的一致性来验证,而不是通过他们返回的图像来验证。我们将 VLM 评委作为决策者进行审核:在 300 个文化背景的提示中,我们将返回的图像与评委从未见过的人类评分以及来自相同候选人的随机选择进行比较,并对重新排序的候选人重复每个决定。 4B 参数判断几乎无法击败随机,并且未达到 CLIP 相似性基线。它会选择 49% 的调用中显示的第一张图像(几率:28%),而重新排序会更改 60% 的提示中的选择。对于这位评审来说,不同命令之间的一致意见具有重要意义:重新排序后的决策比随机决策要好得多,而与较弱的第二个评审的一致意见则保留了错误的决策。 8B 判断几乎没有立场偏差,并且表现优于 CLIP,但对于它来说,相同的过滤器大多会丢弃好的决策。协议只有在针对评审的失败模式时才有帮助,因此只要评审发生变化,就必须重新审核过滤器。在跨命令或与更大的评审进行汇总后,4B 评审的刻板印象评级略有上升,不再可察觉。