论文
CrossTimeEdit:跨越十年的跨视图数据集和历史街景生成的奖励引导编辑
CrossTimeEdit: A Decade-Spanning Cross-View Dataset and Reward-Guided Editing for Historical Street-View Generation
摘要
历史街景图像记录了城市的演变,但覆盖范围不均,在历史记录中留下了巨大的空白。生成可信的过去外观需要恢复变化的结构,同时保留持久的场景内容。我们构建了 VIGOR-his,一个跨越十年的跨视图数据集,包含三大洲 11 个城市的 43,653 个位置级四元组。其自动化管道执行空间配对、一致性筛选、变更分类以及基于卫星的变更描述和本地编辑指令的生成和验证。基于VIGOR-his,我们提出了CrossTimeEdit,一种将历史街景生成重新表述为编辑的模型,使用最近的街景来约束视点和不变的外观以及时间卫星差异作为变化证据。从 FLUX.2 [Klein] 4B 开始,我们通过监督微调(SFT)和在线强化学习(RL)来训练 CrossTimeEdit。我们设计了三个街景编辑标准,即指令对齐(IA)、背景保留(BP)以及质量和物理合理性(QP),作为强化学习奖励维度和评估指标。我们使用流匹配模型的组内相对策略优化 (Flow-GRPO) 和组奖励解耦标准化策略优化 (GDPO) 来优化这个多奖励目标,该优化在聚合之前对每个奖励维度进行标准化。 CrossTimeEdit 将三个编辑标准的整体性能比预训练基线提高了 17.12%,并且在场景一致性、视觉真实感和感知质量方面优于跨视图生成模型。实现代码、数据集和模型权重可在 https://luhanwen67.github.io/CrossTimeEdit-release/. 获取