论文
多模态模型能像人一样评述摄影审美吗?开放式审美推理评估
Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models
摘要
开放式审美评论没有唯一正确答案,现有评估多用数值评分,而非人们实际写出的评论。研究在八种提示条件下,将八个70亿至3,970亿参数的开放权重多模态模型和GPT-5.5,与1,227篇r/photocritique帖子中多条已排序的人工评论比较。严格词汇与学习指标仅弱对应人工评论,粗粒度嵌入余弦则显示主题重叠;要求更短评论会提高相似性,去掉图像几乎不改变分数,说明指标更多反映长度、帖子文本和稳定评论风格,而非图像特有观察。主要条件下,四个LLM评审器均更偏好前沿模型评论而非人工评论,但对70亿至80亿参数模型,相同配对的偏好比例从9%到81%不等。改问两条评论实质有多相似时,模型评审与两名人工标注者一致给出1至5分量表上的1.81–2.59分,接近“大部分不同”。模型评论往往覆盖几乎所有审美方面,而人工有选择性;即使要求人工评论长度,模型对同一照片仍重复自身。参考相似性奖励了流畅全面的风格,未充分反映人工评论的选择性与具体性。