论文
生成先验是否符合人类对视觉自然性的判断?
Do Generative Priors Align with Human Naturalness Perception?
摘要
视觉生成模型经过训练来捕获自然图像的概率分布,但它们的本机先验是否反映了人类对图像自然度的感知的规律仍然是一个悬而未决的问题。在这里,我们通过 25 个开放图像和视频生成器的本机预测误差来探究这些先验。由于原始单图像损失主要由场景内容和视觉复杂性决定,因此我们使用内容保留、配对关系干预来评估方向损失差异,这些干预措施选择性地破坏面部配置或物理照明一致性,同时限制低级图像统计数据的变化。在这两个领域中,这些损失差异再现了类人的选择性敏感性和公差,捕获了面部的经典撒切尔效应以及对照明不一致的形状依赖性响应。值得注意的是,这些损失差异可靠地跟踪了各个刺激对中人类自然性判断的连续等级(面部上的峰值为 $r = .84$,物理场景上的峰值为 $.64$),并保留了独特的人类对齐 即使在控制了来自冻结视觉编码器的特征距离和标准图像质量指标之后,也能发出信号。我们还发现,虽然对这些违规行为的整体敏感度与模型之间的人类对齐有很大的共变,但这两者沿着去噪时间表系统地解耦,对齐峰值早于敏感度,这表明类人的自然性判断与一般违规检测无关。总之,这些发现表明,学习视觉分布会产生生成损失景观,捕捉人类自然感知的不同方面。
