论文
超越情感提示:由价-唤醒-主导驱动的细粒度文本到图像生成
Beyond Emotion Prompts: Fine-Grained Text-to-Image Generation Driven by Valence-Arousal-Dominance
摘要
尽管文本到图像模型可以准确地描绘主题和场景,但创作者仍然难以在不重写其内容描述的情况下指定图像应传达的细粒度情感。自然语言可以暗示情感,但它不提供具有稳定含义和有序强度的控制尺度。我们提出了 EMOTRANS,它将基于心理的价-唤醒-支配(VAD)坐标转换为独立于内容文本并在去噪阶段进行调制的生成条件,使情感风格成为可精细调节的创意变量。为了支持这一目标,我们构建了 EMOVAD,这是一个艺术绘画数据集,它将客观内容描述与从多个注释者单独收集的情感评级配对。我们还通过共享模型的双分支训练来协调情感表达和内容保存。客观和人性化的评估表明,该框架提高了三维情感控制的准确性,并产生可感知的、可有序的连续变化,同时保持有竞争力的文本对齐和图像质量。这项工作提供了一种实用的情感驱动的图像生成方法,将客观内容描述扩展到细粒度的情感调整。