论文
AesCanvas:审美批判和语境适应性的大型数据集和基准
AesCanvas: A Large-Scale Dataset and Benchmark for Aesthetic Critique and Contextual Suitability
摘要
多模态 大语言模型 (MLLM) 的最新进展已将图像美学评估 (IAA) 扩展到标量分数之外,转向可解释的批评和指导。然而,现有的基准主要评估内在视觉质量或固定领域标准,而吸引人的图像是否适合特定目的、受众、文化环境或领域惯例则没有定论。我们推出了 AesCanvas,这是一个具有两个互补组件的统一套件:CritiqueCanvas 具有来自 54,300 张图像的 519,136 个指令响应对,支持跨摄影、绘画和虚拟图像的长格式、多维评论,而 ContextCanvas 具有 301 个经过专家评审的使用场景,可评估现实使用场景中的情境美学适用性。在统一的协议下,我们评估闭源前沿、开放权重通用和特定于美学的 MLLM。结果揭示了批评生成和上下文敏感判断之间的明显区别:基于参考的词汇和语义指标仅部分捕获了批评质量,而美学专家在选定的批评指标上仍然具有竞争力,但大大落后于 ContextCanvas 上强大的通用 MLLM。进一步的分析表明,审美专业化并不能可靠地转化为情境适应性,并且模型决策可能无法跟踪或立足于决定性的情境视觉线索。这些发现将文化定位、以证据为基础的适宜性确立为审美建模的独特目标。