论文

Pose-ICL:用于姿势可控主题定制的 3D 感知情境学习

Pose-ICL: 3D-Aware In-Context Learning for Pose-Controllable Subject Customization

模型架构Transformer

摘要

主题定制是现代图像生成的一项基本任务。通过提供一些参考图像和文本提示,用户可以在任何所需场景中生成特定对象的图像。然而,现有的方法仍然难以实现对定制主体的有效姿势控制。在实践中,他们经常表现出不准确的姿势或不一致的交叉姿势外观。这些限制表明,以体积方式理解对象对于 2D 原生骨干网来说仍然是一个重大挑战。为了应对这一挑战,我们提出了 Pose-ICL,这是一种免调整框架,利用 3D 感知上下文学习 (ICL) 通过多个配对图像姿势参考直接适应新主题。其核心机制是表面锚定位置嵌入 (SAPE),通过将图像标记锚定到体积边界框的表面坐标,为模型提供明确的 3D 感知。专门的改进确保其与现有 DiT 模型的无缝兼容性。对 3D 资产和现实世界主题的广泛评估表明,Pose-ICL 在姿势准确性和身份一致性方面均明显优于当前方法。