论文

OmniDS:双流上下文融合,实现鱼眼相机的全向深度

OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras

应用与实践视觉感知与空间理解

摘要

多鱼眼相机装置的全向深度估计因可见性冲突而变得复杂:宽基线导致不同相机观察同一物体的不同部分,甚至不同的面,因此在固定投影下将它们的特征聚合成统一的等距矩形(ERP)表示会在遮挡边界和薄结构附近产生模糊的匹配证据。尽管现有方法通过降低不可靠视图的权重来缓解这一问题,但它们并不能解决潜在的差异,因为上下文形成和跨视图融合仍然与严格的鱼眼到 ERP 采样相关。我们提出了 OmniDS,这是一种迭代深度细化框架,通过将动态上下文融合与共识感知的多视图相似性相结合来取代严格的聚合。双流编码器将用于几何细节的轻量级 CNN 与用于语义先验的冻结 DINOv3 配对;它们的特征在每个细化步骤中通过学习视图权重和具有几何失真偏差的可变形交叉注意力重新投影到 ERP 空间中。同时,多视图共识卷通过分组相关性和特征方差捕获全局跨相机一致性,并通过 3D U-Net 进行正则化。为了高效部署,我们将双流表示提炼成单个基于 MobileNet 的编码器。 OmniDS 在 OmniThings、OmniHouse 和 Sunny 基准测试中实现了最先进的性能,同时保持了具有竞争力的推理速度。项目页面和代码可在 https://parkchaesong.github.io/omnids 获取。