论文

向小组提供维度,而不是结论:视觉语言审美评判者的量规分解融合

Feed the Panel Dimensions, Not Verdicts: Rubric-Decomposed Fusion of Vision-Language Aesthetic Judges

模型评测评测方法与指标

摘要

视觉语言模型(VLM)被部署为图像美学的零样本评判,并且在证据不足的情况下推荐多个模型的面板,作为使此类评判可靠的方法。在两个人类评分数据集 EVA 和 PARA 上,我们发现,无论判决是由学习组合器平均还是融合,整体评委小组从未明显击败其最佳成员。面板的价值取决于它所提供的内容。因此,我们让每个模型在冻结的、人工编写的标题的五个维度上对每个图像进行评分,并使用折叠组合器将这些分数与每个模型的结论一起跨模型系列融合。维度分数衡量其标签所声称的内容:在将人类总体分数部分化的情况下,维度提示在 30 个模型属性单元格中的 28 个中比整体提示携带更多属性特定信息。融合后,它们在 EVA 上击败了所有 10 个三系列面板中最好的单一 VLM(相对于最佳单一模型,最强三重奏 +0.07 Spearman rho,预先声明的 +0.10,当超过 20 倍分区的平均值时 +0.06 和 +0.07;相对于面板平均值,主要测试在其 EVA 设计集上给出 +0.118),并且在 PARA 上,它们在 Spearman rho 下达到了同等水平在 Kendall tau-b 下,一个模型已经捕获了 85% 的人类噪声上限,但出现了较小的、不显着的损失。它不是一个特征计数人工制品:给同一个组合器相同数量的纯整体列,从相同的重复中分离出来,不会重现它。增益成本为数百个标签,这些标签不会在数据集之间传输,并且 EVA 上的 API 调用增加了 4.8 倍;我们用配对的引导程序和 Kendall tau-b 来报告它,以及失败的预注册和丢失的配置。