论文
视觉审美标杆:前沿模特能评判美吗?
Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?
摘要
多模态 大语言模型 (MLLM) 现在通常用于视觉理解、生成和管理。这些应用程序的很大一部分需要明确的审美判断。大多数现有解决方案将这种判断简化为预测单个图像的标量分数。我们首先询问这样的分数是否忠实地捕捉了比较偏好:在八位专家注释者的对照研究中,分数派生的排名与相同注释者的直接比较不一致,而直接排名在最佳和最差图像标签上产生了更高的注释者间一致性。受这一发现的启发,我们引入了视觉审美基准(VAB),它将审美评估视为对具有匹配主题的候选集的比较选择。 VAB 包含 400 个任务和 1,195 个图像,涉及美术、摄影和插图,每个任务的标签来自 10 名独立专家评委的共识。通过评估 20 个前沿 MLLM 和 6 个专用视觉质量奖励模型,我们发现最强的系统在候选顺序的三种随机排列中正确识别最佳和最差图像的比例仅为 26.5%,远低于人类专家所达到的 68.9%。 微调 2,000 个专家示例的 35B 参数模型其精度接近 397B 参数开放权重模型,表明 VAB 中的比较信号是可转移的。总之,这些结果揭示了当前多模态模型与专家审美判断之间明显且可测量的差距,VAB 提供了第一个基于集合的、以专家为基础的测试平台,可以在该测试平台上跟踪和缩小该差距。