论文
ToPO:基于注意力的潜在扩散模型的词元条件偏好路由
ToPO: Token-Conditioned Preference Routing for Attention-Based Latent Diffusion Models
摘要
成对偏好标签对完整图像进行排序,而 Diffusion-DPO 将其效果应用于许多空间和去噪时间坐标。对于基于注意力的噪声预测潜在扩散,ToPO(面向词元的偏好优化)根据冻结参考降噪器中的分支平方残差对比度构造了每小批量、独立、可分离的时空路径。首选分支交叉注意力使用内容标记来调制空间因子,并添加辅助像素中点排序项,而无需本地标签或学习的奖励模型。在具有共享更新计划的匹配三种子再训练中,在所有五个报告的 SD-1.5 指标以及 HPSv2、ImageReward 和 SDXL 的 CLIP 上,ToPO 的端点估计值高于 Diffusion-DPO。它还在总计盲目 SDXL A/B 研究中获得了更大的原始胜利份额。这些发现仅限于报告的等更新 U-Net 协议,而不是等计算比较。