论文

MIVIFI:桥接透视域和鱼眼域,用于训练多视图鱼眼图像生成模型

MIVIFI: Bridging Perspective and Fisheye Domains for Training Multi-View Fisheye Image Generation Models

模型训练监督微调与指令调优

摘要

实现 360° 覆盖对于自动驾驶车辆的视觉感知系统至关重要。鱼眼摄像机提供了一种经济高效的解决方案,只需两个传感器即可实现完整的环绕覆盖。然而,现有的多视图鱼眼数据集有限,并且合成罕见的极端情况通常需要计算成本高昂的 3D 模拟,这阻碍了训练。虽然生成模型在标准透视图像中取得了巨大成功,但它们在广角畸变中的应用仍未得到探索。在这项工作中,我们正式介绍了基于体积语义表示的多视图鱼眼图像生成的新问题,并提出了两种不同的方法。我们首先提出了 SyntheOcc-FE,它将 SyntheOcc 架构适应鱼眼数据。虽然有效,但该方法受到鱼眼数据集稀缺的限制,从而限制了其泛化。为了克服这些限制,我们提出了第二种方法,MIVIFI(多视图鱼眼),它利用等矩形投影的跨域学习。通过使用 KITTI-360 鱼眼图像和 nuScenes 多视图标准图像来弥合数据集域之间的差距,我们的方法可以实现场景内容的高保真操作。该框架能够对语义占用输入进行结构修改,以引入或消除特定的参与者,并有助于渲染有限鱼眼数据集中缺少的各种气象条件和照明场景。定量和定性实验表明,我们的方法实现了强大的真实感多视图鱼眼图像生成,并突出了我们的跨域策略处理数据稀缺的具体优势。