论文
偏好顺序,评级锚点:从融合专家审美 真值 到自我 蒸馏
Preferences Order, Ratings Anchor: From Fused Expert Aesthetic Ground Truth to Self-Distillation
摘要
成对偏好和逐点评分是图像美学评估(IAA)中的两种主要注释协议,但现有基准仅采用其中一种,在受控条件下无法测量它们的互补性。我们引入了 PPaint,一个匹配的双协议基准,其中 15 名领域专家,每个类别 5 名,在两个协议下跨越五个审美维度对 150 幅中国画进行注释,通过局部密集的偏好设计和匹配的评级收集了 45,900 成对的专家判断。匹配的设计揭示了互补的优势:偏好产生更一致的顺序排名,而评级则锚定绝对分数尺度。通过两种独立的偏好评分方法融合这两个信号,产生融合的专家 真值,在该专家中,两种结构收敛到几乎相同的分数。同样的评分偏好原则也适用于无标签 VLM 训练。 PSDistill 通过 Elo 参考池将 VLM 成对判断转换为校准的伪分数,并通过置信度加权排名优化训练相同的 VLM,以生成单通道美学评分器。在单一绘画类别上进行训练后,经过蒸馏的 Qwen3-VL-8B 将所有三个类别的平均 SRCC 从 0.504 提高到 0.709,优于所有开源基线,包括专用美学模型 ArtiMuse,并以单次推理成本在 0.04 SRCC 内匹配闭源 Gemini-3.1-Pro,并在 APDDv2 上进一步验证了跨域传输。我们将发布完整的 PPaint 数据集和训练代码。