论文

生成先验是否符合人类对视觉自然性的判断?

Do Generative Priors Align with Human Naturalness Perception?

模型评测应用与实践模型行为与机制分析内容创作

摘要

视觉生成模型经过训练来捕获自然图像的概率分布,但它们的本机先验是否反映了人类对图像自然度的感知的规律仍然是一个悬而未决的问题。在这里,我们通过 25 个开放图像和视频生成器的本机预测误差来探究这些先验。由于原始单图像损失主要由场景内容和视觉复杂性决定,因此我们使用内容保留、配对关系干预来评估方向损失差异,这些干预措施选择性地破坏面部配置或物理照明一致性,同时限制低级图像统计数据的变化。在这两个领域中,这些损失差异再现了类人的选择性敏感性和公差,捕获了面部的经典撒切尔效应以及对照明不一致的形状依赖性响应。值得注意的是,这些损失差异可靠地跟踪了各个刺激对中人类自然性判断的连续等级(面部上的峰值为 $r = .84$,物理场景上的峰值为 $.64$),并保留了独特的人类对齐 即使在控制了来自冻结视觉编码器的特征距离和标准图像质量指标之后,也能发出信号。我们还发现,虽然对这些违规行为的整体敏感度与模型之间的人类对齐有很大的共变,但这两者沿着去噪时间表系统地解耦,对齐峰值早于敏感度,这表明类人的自然性判断与一般违规检测无关。总之,这些发现表明,学习视觉分布会产生生成损失景观,捕捉人类自然感知的不同方面。

生成先验是否符合人类对视觉自然性的判断?:论文原图
图 1:实验范式和配对响应曲线概述。 (A) 测量管道。左:对观察者的人类自然度评级进行平均,以定义配对的感知效果 hh。右图:冻结模型的本机预测误差在匹配的时间步长和噪声上进行平均,以获得图像损失和成对的方向损失差 umu_{m}(示意图显示了噪声预测扩散模型;预测目标因架构而异)。 (B) 受控刺激对和代表性反应曲线。保留内容的关系干预会翻转局部元素(眼睛/嘴、地板或中心物体;红色框),使整体场景构成保持完整。撒切尔夫人:人类和生成模型对直立面孔的面部扭曲的惩罚比倒立面孔的惩罚要严重得多。照明:投射阴影、光线方向和反射的因子级对比度;生成模型反映了人类对阴影和光照的敏感性。 †反射颜色是一种代表性发散,人类对小的色调不匹配仍然敏感 同时生成反应减少。标记表示具有 95% bootstrap 间隔的人类平均值(附录 E)、排名前五的生成模型(中值和个体)以及排名前五的视觉编码器(中值)。完整的个人资料:附录 J。面部图像描绘了一个合成人以供说明,未在实验中使用。