论文
嵌入算法:一种轻量级、免调整的框架,用于减轻文本到图像模型中的事后偏差
Embedding Arithmetic: A Lightweight, Tuning-Free Framework for Post-hoc Bias Mitigation in Text-to-Image Models
摘要
现代文本到图像(T2I)模型放大了有害的社会偏见,挑战了它们的道德部署。我们引入了一种推理时间方法,可以可靠地减轻社会偏见,同时保持提示语义和视觉上下文(背景、布局和风格)完好无损。这确保了上下文的持久性,并提供了一个可控参数来调整缓解强度,使从业者能够对公平性与一致性的权衡进行细粒度的控制。使用嵌入算法,我们分析嵌入空间中的偏差是如何构造的,并在不改变模型权重、提示或数据集的情况下纠正它。 FLUX 1.0-Dev 和 Stable Diffusion 3.5-Large 上的实验表明,条件嵌入空间形成了一个复杂的纠缠流形,而不是解纠缠概念的网格。为了严格评估语义保留,超越 CLIP 分数的循环性和偏差限制,我们提出了概念连贯性分数(CCS)。根据这个稳健的指标进行评估,我们的轻量级、免调整方法在提高多样性的同时保持高度概念一致性方面显着优于现有基线,有效解决了关键的公平性与一致性的权衡。通过描述模型如何表示社会概念,我们建立了对潜在空间的几何理解,作为实现更透明、可控和公平的图像生成的原则路径。