论文
WithEveryone:统一规划、身份扎根,塑造群体形象
WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
摘要
当场景必须包含许多指定的人时,保留身份的图像生成变得越来越不可靠。除了保留每个身份之外,模型还必须将每个引用绑定到不同的人和位置,而训练时的身份损失必须在几个有噪声的预测面孔之间建立对应关系。我们推出了 WithEveryone,一个统一的框架,用于生成最多十个参考身份的群组图像。 WithEveryone 将每个选定的身份注入为寻址词元,预测结构化身份布局计划,并将该计划呈现为视觉条件。其主要目标是 Layout-Grounded ID Loss,使用带注释的人脸区域直接监督预期身份,避免不稳定的基于嵌入的人脸匹配; ID 表示强制在图像合成之前额外训练每个身份的预测。在身份不相交基准上,WithEveryone 实现了最高的目标上下文身份相似度,将 GPT-Image-2 的人脸相似度从 0.462 提高到 0.499,同时将复制粘贴伪影从 0.169 减少到 0.055。它还覆盖了 97.3% 的请求身份,重复率仅为 2.8%。这些结果表明,明确的身份布局基础使得身份保留生成能够扩展到更大的群体,而不依赖于直接参考面部复制。