论文
视觉语言模型为个性化图像美学评估编码什么?
What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?
摘要
个性化图像美学评估(PIAA)是具有实际应用的重要研究问题。虽然基于视觉语言模型 (VLM) 的方法是 PIAA 的有希望的候选者,但目前尚不清楚它们是否内部编码了有效个性化所需的丰富、多层次的美学属性。在本文中,我们首先分析 VLM 的内部表示,以检查此类美学属性的存在和分布,然后利用它们进行轻量级、个人级个性化,而无需模型 微调。我们的分析表明,VLM 编码了传播到语言解码器层的多种美学属性。基于这些表示,我们证明简单的线性模型可以有效地执行 PIAA。我们进一步分析了美学信息如何在不同的 VLM 架构中跨层以及跨图像域传输。我们的研究结果提供了关于如何利用 VLM 来建模主观、个人审美偏好的见解。我们的代码可在 https://github.com/ynklab/vlm-latent-piaa 获取。