论文

InstancePin:通过坐标固定实现实例可寻址布局到图像的扩散

InstancePin: Instance-Addressable Layout-to-Image Diffusion via Coordinate Pinning

模型架构Transformer

摘要

布局到图像扩散模型通过在类别级分割图上调节生成,实现了令人印象深刻的语义可控性。然而,这种类别对齐控制不一定是实例可寻址的:来自同一类别的多个附近对象通常被视为共享语义区域,导致实例之间边界不明确、外观平均和特征混乱。这种限制在城市场景合成中尤其明显,其中小而拥挤的行人或车辆需要细粒度的实例分离,同时保持全局场景一致性。在本文中,我们提出了 InstancePin,一种实例可寻址的布局到图像扩散框架,它使用显式坐标锚固定每个对象实例。 InstancePin 不是直接将实例掩码注入预训练的主干,而是引入了一个独立的实例感知适配器,以在学习特定于实例的空间控制时保留类别级生成先验。对于每个实例,其中心坐标都用傅立叶特征进行编码,并投影到坐标标记中,该坐标标记充当通过坐标固定注意力由潜在图像特征查询的空间锚点。为了使这些锚点具有空间意义,我们进一步监督具有实例区域的坐标注意图,鼓励每个坐标标记激活其相应的对象区域。最后,实例掩码引导融合模块将预训练的主干特征路由到非实例区域,并将适配器特征路由到实例区域,从而在不牺牲全局语义保真度的情况下实现局部实例细化。对 Cityscapes 的大量实验表明,InstancePin 减轻了密集布局中的实例纠缠,并提高了图像保真度和语义一致性。