论文
通过强化学习和效价唤醒锚定来平衡图像生成中的情感一致性和语义一致性
Balancing Emotional Alignment and Semantic Consistency in Image Generation via Reinforcement Learning with Valence-Arousal Anchoring
摘要
文本到图像生成中的连续情感控制需要一个模型来改进情感对齐,而不改变提示所描述的对象、布局或场景。现有的监督情绪注入方法通常会优化特征空间代理,因此可能会表现出情绪语义漂移,其中更强的情绪调节伴随着意想不到的内容变化。我们使用流匹配图像生成框架来解决这个问题,该框架结合了连续价唤醒(VA)调节、组相对策略优化(GRPO)和中性语义锚。确定性概率流 ODE 转换为边际保留 SDE,产生用于轨迹采样和策略比率估计的非简并转移密度。基于冻结 CLIP 的 VA 回归器提供了测量预测和目标 VA 坐标之间距离的最终奖励,而在零 VA 条件下从相同提示生成的图像为语义保留提供了特征空间参考。在线 RL 采样使用简化的去噪时间表,而在推理时保留原始时间表。对 3,300 种提示-情绪组合的实验显示,与 VA 条件基线相比,效价和唤醒误差显着降低,并且相对于 EmotiCrafter 改进了 CLIPScore,并且在无参考图像质量方面进行了可测量的权衡。结果支持锚正则化 Flow-GRPO 作为平衡连续情感图像合成中的情感对齐和语义一致性的实用方法。