论文
ASTRA:通过检索增强姿势引导和解开位置嵌入增强多主体生成
ASTRA: Enhancing Multi-Subject Generation with Retrieval-Augmented Pose Guidance and Disentangled Position Embedding
摘要
主题驱动的图像生成在创建个性化内容方面取得了巨大成功,但其功能很大程度上仅限于常见姿势的单个主题。当前的方法在处理具有复杂、不同动作的多个主体时面临着根本性的冲突:在保留个体身份的同时强制执行精确的姿势结构。由于外观和结构信号与模型架构纠缠在一起,这一挑战通常会导致身份融合和姿势失真。为了解决这一冲突,我们引入了 ASTRA(通过目标检索增强的自适应合成),这是一种新颖的框架,它在统一的扩散 Transformer 中从架构上将主体外观与姿势结构分开。 ASTRA 通过双管齐下的战略实现了这一目标。它首先采用检索增强姿势 (RAG-Pose) 管道,从精选数据库中提供干净、明确的结构先验。然后,其核心生成模型学习使用我们的增强型通用旋转位置嵌入(EURoPE)来处理这些双重视觉条件,这是一种非对称编码机制,可将身份标记与空间位置解耦,同时将姿势标记绑定到画布。同时,解缠结语义调制 (DSM) 适配器将身份保存任务卸载到文本调节流中。大量的实验表明,我们的综合方法实现了卓越的解缠结。在我们设计的基于 COCO 的复杂姿势基准上,ASTRA 在姿势依从性方面实现了新的最先进水平,同时在 DreamBench 中保持高身份保真度和文本对齐。