论文
具有少数偏好优化的自我改进扩散分类器
Self-Improving Diffusion Classifiers with Minority Preference Optimization
摘要
先前的研究表明,扩散分类器实现了稳健的零样本分类性能。然而,它们的有效性与预训练数据分布密切相关:它们在数据流形的大多数高密度区域中表现良好,但在少数低密度区域中准确度明显较低。尽管先前关于少数群体抽样的工作主要集中在生成更多类似少数群体的图像,但少数群体抽样从根本上实现超越生成的功能仍未得到充分探索。在本文中,我们揭示了生成中的少数采样与扩散分类器的感知能力之间的直接关系。具体来说,我们表明,加强少数群体抽样可以扩大数据流形上代表性不足的区域的覆盖范围,从而改善基于扩散的识别。为了利用这种联系,我们提出了 \textit{具有少数偏好优化的自我改进扩散分类器}(MiPO),它使用少数偏好奖励来微调预训练的扩散模型。 MiPO 仅使用任意标题数据生成候选样本,奖励那些更好地覆盖少数群体区域的样本,并使用 LoRA 和组相对策略优化来优化模型,无需额外的图像数据、外部基础模型或外部奖励模型。这使得稳定、快速自适应少数采样成为可能,并将低密度生成覆盖转化为改进的零样本扩散分类。综上所述,我们表明扩散分类器感知偏向于多数区域,证明这种偏差可以通过少数偏好优化来缓解,并在五个标准数据集上评估 MiPO。