论文
RefineAnything:针对完美局部细节的多模式区域特定细化
RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details
摘要
我们引入区域特定的图像细化作为专门的问题设置:给定输入图像和用户指定的区域(例如,涂鸦蒙版或边界框),目标是恢复细粒度的细节,同时保持所有未编辑的像素严格不变。尽管图像生成方面取得了快速进展,但现代模型仍然经常遭受局部细节崩溃的问题(例如,扭曲的文本、徽标和薄结构)。现有的指令驱动编辑模型强调粗粒度语义编辑,通常要么忽略细微的局部缺陷,要么无意中改变背景,特别是当感兴趣区域仅占固定分辨率输入的一小部分时。我们提出了RefineAnything,这是一种基于多模态扩散的细化模型,支持基于参考和无参考的细化。基于反直觉的观察,即裁剪和调整大小可以在固定 VAE 输入分辨率下显着改善局部重建,我们提出了 Focus-and-Refine,这是一种以区域为中心的细化和粘贴回策略,通过将分辨率预算重新分配到目标区域来提高细化效果和效率,而混合掩模粘贴回则保证了严格的背景保留。我们进一步引入了边界感知的边界一致性损失,以减少接缝伪影并提高回贴自然度。为了支持这一新设置,我们构建了Refine-30K(20K基于参考的样本和10K无参考样本)并引入了RefineEval,这是一个评估编辑区域保真度和背景一致性的基准。在RefineEval上,RefineAnything在竞争基线和近乎完美的背景保留上取得了显着改进,为高精度局部细化建立了实用的解决方案。项目页面:https://limuloo.github.io/RefineAnything/。