论文
汽车近红外图像中稳健的合成到真实语义分割的纹理形状偏差平衡
Texture-Shape Bias Balancing for Robust Synthetic-to-Real Semantic Segmentation in Automotive NIR Imagery
摘要
语义分割是现代汽车系统视觉感知的基本组成部分,可实现像素级场景理解。近红外成像 (NIR) 在困难的照明条件下提供稳定的检测,但由于缺乏来自现实场景的高质量注释数据,特定领域语义分割模型的开发仍然具有挑战性。合成数据集提供了一种可扩展的替代方案,但在合成图像上训练的模型在转移到真实领域时通常会出现性能下降。我们提出了第一个关于汽车领域近红外图像语义分割的合成到真实域适应的系统研究。我们提出了一个生成增强框架,通过我们引入的目标样式适应(TSA)将合成图像转换为逼真的 NIR 样式变体。 TSA 通过对一小部分精选的真实 NIR 图像进行低秩自适应来微调潜在扩散模型,并使用保留结构的多信号调节将其应用于合成训练数据。为了减少纹理偏差并提高分割鲁棒性,我们进一步应用基于 Voronoi 的风格多样化策略(VSD),该策略修改原始纹理,同时保留场景几何形状。对来自车辆内部和街道场景的 NIR 数据的多个模型架构进行的实验表明,在训练过程中平衡归纳偏差可显着增强语义分割的鲁棒性,并有效地将现实场景中的外部数据和内部数据的域差距减少高达 63.6% 和 28.4%。该代码可在 GitHub 上获取。