论文

COLLAR:用于高保真条件生成的级联对象级潜在细化

COLLAR: Cascaded Object-Level Latent Refinement for High-Fidelity Conditional Generation

模型推理解码与生成控制

摘要

尽管引入了深度和 Canny 贴图等结构先验,但在 Diffusion Transformer 中实现高保真对象级控制仍然是一个重大挑战。当前的对象级条件生成方法经常受到视觉伪影的影响,并且难以保持对小局部区域内的对象的精确控制。为了解决这些限制,我们提出了级联对象级潜在细化(COLLAR),这是一种 无需训练 框架,可通过视场(FoV)扩展逐步优化对象级功能。首先,我们提出跨尺度语义对齐(CSSA)模块,通过注意力机制将对象级特征注入扩展 FoV 分支来解决空间语义差距。为了进一步优化这些功能,循环特征注入(CFI)模块引入了交互后台反馈机制。它利用基于频率的自适应策略,通过上下文对齐的本地信息有选择地更新全局主干。最后,扩展视场分支充当特征优化的中心,确保将对象级特征集成到全局生成过程中,而不会影响最终图像质量。对 COCO-MIG 和 COCO-POS 基准的大量实验表明,我们的方法在语义对齐、图像质量和空间保真度方面始终优于最先进的方法。