论文
SatisDive:文生图的满足-多样性前沿
Traversing the Satisfaction-Diversity Frontier in Text-to-Image Diffusion
摘要
文生图让用户可以探索同一提示生成的多张图像。要使这些图像有用,每张都须反映用户偏好(以学习到的奖励衡量),又要彼此视觉不同以保持多样性。现有方法要么分别处理奖励与多样性,要么把两者合成一个聚合分数,使高多样性抵消低奖励。本文把生成表述为satisficing:每张候选图须满足奖励下限,整批图须满足多样性截断;奖励下限控制最差候选奖励与批多样性的平衡,我们证明变化该下限定义了一条帕累托前沿。为遍历该前沿,我们提出免训练的推理时方法SatisDive:用批相对奖励截断区分低奖励与高奖励候选,对截断下候选强调奖励改进、对截断上候选强调多样性。在Pick-a-Pic上匹配DreamSim时,以FLUX.1-dev为基座、HPSv3为奖励,SatisDive的最差候选奖励较FK steering最高提升0.43;以SANA-1.6B为基座、ImageReward为奖励最高提升0.70。更广地,在其重叠的DreamSim范围内,SatisDive的满足-多样性曲线在每个设置下都帕累托支配FK steering。