论文

美在于情人的人工智能:MLLM 系统性地高估了面部吸引力

Beauty is in the AI of the beholder: MLLMs systematically overrate facial attractiveness

模型评测模型行为与机制分析

摘要

Multimodal 大语言模型 (MLLM) 的美容评估越来越受到用户、公司和美容师的欢迎。这就提出了一个问题:这些人工智能模型是否能够准确反映人类对吸引力的判断。在一项预先注册的探索性研究中,我们将 2,513 名人类参与者的吸引力评级与四种广泛使用的商业人工智能模型进行了比较:Claude、Gemini、GPT 和 Grok。结果表明,与人类相比,MLLM 系统地对面孔进行更有利且范围更窄的评分,并且在研究时,不会以绝对值再现人类评分。然而,MLLM 与人类吸引力判断表现出很强的相关性,可以准确跟踪面孔的排名顺序。 MLLM 可能会通过与人类不同的线索来判断面孔;在人类和 MLLM 中,只有面部年龄是面部吸引力的预测因子,不同种族和性别模型之间的模式不一致。人工智能模型彼此之间的一致性非常好,但 Grok 除外,它与人类的一致性也最低。我们的研究结果表明,虽然它们可能能够对人类吸引力进行近似排名,但当前现成的商业 MLLM 系统性地高估了人脸的美丽。