论文
EmoScene:用于可控情感图像生成的双空间数据集
EmoScene: A Dual-space Dataset for Controllable Affective Image Generation
摘要
文本到图像的扩散模型实现了高视觉保真度,但细粒度的情感控制仍然很困难,因为文本情感线索通常无法指定情感表达背后的视觉感知因素。现有的视觉效果数据集同样通常仅限于离散标签、特定领域或感知属性的有限监督。我们推出了 EmoScene,一个用于生成可控情感图像的大规模双空间数据集,包含 300 多个场景类别的 120 万张图像。它的情感空间共同代表离散的情感和连续的价-唤醒-支配(VAD),它的感知空间记录可测量的外观属性,以及基于场景语义的上下文描述。 EmoScene 将多模型注释与人在环质量控制相结合。对 30,519 张图像的随机审核在离散情感标签上产生了 91.22% 的一致性,而独立的多评估者评估则产生了 Fleiss 的 $κ=0.85$。在控制源和场景组成后,情感维度和感知属性在数据源之间表现出稳定的关联,反映了统计趋势而不是确定性的视觉规则。为了演示数据集的实用性,我们进一步开发了 AffectCtrl,它学习冻结扩散模型的调节空间中的残差,以支持分类情感生成以及对 VAD、亮度和饱和度的连续控制。 AffectCtrl 实现了 85.75% 的分类情感准确度,在共享评估协议下的效价和唤醒控制方面优于 EmotiCrafter,并在所有五个连续轴上获得 0.673--0.765 的 Pearson 相关性。这些结果表明,EmoScene 为分析和控制视觉生成中的情感表达提供了可扩展的数据基础。