面向结构与语义一致Sim-to-Real转换的小波相位扩散
Wavelet Phase Diffusion for Structurally and Semantically Consistent Sim-to-Real Translation
摘要
仿真到现实(Sim-to-Real)转换必须弥合合成域与真实域之间的外观差距,同时保持结构与语义一致性。基于条件控制的方法实现了空间对齐,但引入了计算昂贵的控制模块。成对数据方法能达到真实感,但依赖复杂的合成流水线,且常常改变场景几何与语义。免训练编辑方法避免了这两种约束,但缺乏习得的外观先验,限制了其感知质量。近期提出的相位保持扩散提供了一种有前景的替代方案,但傅里叶域的表述受全局谱耦合的约束。这种耦合会引发振铃与边界泄漏等空间伪影,从而损害结构与语义一致性。我们提出小波相位扩散(Wavelet Phase Diffusion),通过两个组件解决这一问题。首先,我们在双树复小波包变换(Dual-Tree Complex Wavelet Packet Transform)域中工作,其局域化的小波包支持空间自适应的相位注入,而不受全局谱干扰。其次,低频随机化(Low-Frequency Randomization, LFR)替换低频小波包,将模型与合成光照先验解耦,使真实世界外观处于分布之内。两个组件都在非成对的开源域数据上训练,且引入的推理开销可忽略不计。空间局域性进一步支持实例级转换:单个物体或区域可独立转换为照片级真实外观,而周围场景保持不变。在vKITTI $\to$ KITTI图像转换上,我们的方法在真实感与语义一致性上超越以往方法,同时保持有竞争力的结构对齐。在CARLA视频转换上,我们的方法接近成对数据方法的真实感,同时将VLM规划器的ADE和FDE分别降低 $5.4\%$ 和 $5.1\%$。
