论文

TransPhy:基于物理的图像编辑的视觉上下文学习

TransPhy: Visual In-Context Learning for Physically Grounded Image Editing

摘要

视觉演示提供了一个自然的界面,用于指定难以用文本详尽描述的图像转换。然而,现有的视觉上下文学习(VICL)方法主要关注外观层面的关系迁移,并为基于物理的转换提供有限的支持,其结果取决于材料属性、几何形状、对象交互和环境条件。给定源-目标样本对和查询图像,物理基础的 VICL 需要一个模型来推断演示的变换,使其效果适应特定于查询的场景上下文,并保留与规则无关的内容。我们引入了 PhysVICL-74,其中包含 74 个基于物理的转换规则和 5,240 个源-目标图像对,形成近 75K 的训练和评估上下文。其基准分割分别评估新颖实例转移和未见规则泛化。我们进一步提出了 TransPhy,一个将物理基础 VICL 分解为物理规则归纳和过渡对齐渲染的框架。 TransPhy 首先预测演示的规则和明确的特定于查询的目标状态描述,然后通过词元明智的专家混合适应来合成目标图像,并由局部转换线索引导专家路由。实验表明,与现有的视觉上下文编辑方法相比,TransPhy 提高了物理规则遵守性、查询一致性和未见规则泛化能力。