论文

面向结构与语义一致Sim-to-Real转换的小波相位扩散

Wavelet Phase Diffusion for Structurally and Semantically Consistent Sim-to-Real Translation

模型推理解码与生成控制

摘要

仿真到现实(Sim-to-Real)转换必须弥合合成域与真实域之间的外观差距,同时保持结构与语义一致性。基于条件控制的方法实现了空间对齐,但引入了计算昂贵的控制模块。成对数据方法能达到真实感,但依赖复杂的合成流水线,且常常改变场景几何与语义。免训练编辑方法避免了这两种约束,但缺乏习得的外观先验,限制了其感知质量。近期提出的相位保持扩散提供了一种有前景的替代方案,但傅里叶域的表述受全局谱耦合的约束。这种耦合会引发振铃与边界泄漏等空间伪影,从而损害结构与语义一致性。我们提出小波相位扩散(Wavelet Phase Diffusion),通过两个组件解决这一问题。首先,我们在双树复小波包变换(Dual-Tree Complex Wavelet Packet Transform)域中工作,其局域化的小波包支持空间自适应的相位注入,而不受全局谱干扰。其次,低频随机化(Low-Frequency Randomization, LFR)替换低频小波包,将模型与合成光照先验解耦,使真实世界外观处于分布之内。两个组件都在非成对的开源域数据上训练,且引入的推理开销可忽略不计。空间局域性进一步支持实例级转换:单个物体或区域可独立转换为照片级真实外观,而周围场景保持不变。在vKITTI $\to$ KITTI图像转换上,我们的方法在真实感与语义一致性上超越以往方法,同时保持有竞争力的结构对齐。在CARLA视频转换上,我们的方法接近成对数据方法的真实感,同时将VLM规划器的ADE和FDE分别降低 $5.4\%$ 和 $5.1\%$。

面向结构与语义一致Sim-to-Real转换的小波相位扩散:论文配图
图 3:ψ​-PD\psi\text{-PD} 概述。源和噪声潜伏被 DT-ℂ\mathbb{C}WPT 分解为一个低频数据包和多个高频数据包。源相位(绿色)在截止图 𝐅\mathbf{F} 下注入每个数据包,同时低频数据包被随机化 (LFR),逆变换产生结构化噪声 ϵ^\hat{\boldsymbol{\epsilon}}。