论文

FishRoPE:用于全向视觉感知的投影旋转位置嵌入

FishRoPE: Projective Rotary Position Embeddings for Omnidirectional Visual Perception

模型架构Transformer

摘要

视觉基础模型(VFM)和鸟瞰图(BEV)表示具有显着先进的视觉感知,但它们的内部空间表示采用针孔相机的直线几何形状。鱼眼摄像机因其环视覆盖而广泛部署在量产型自动驾驶汽车上,但其表现出严重的径向畸变,导致这些表示在几何上不一致。与此同时,大规模鱼眼注释的稀缺使得从头开始重新训练基础模型变得不切实际。我们提出了一个轻量级框架,它通过两个组件使冻结的 VFM 适应鱼眼几何:具有低秩适应 (LoRA) 的冻结 DINOv2 主干,无需特定任务的预训练即可将丰富的自监督特征转移到鱼眼;以及鱼眼旋转位置嵌入 (FishRoPE),它重新参数化鱼眼投影的球坐标中的注意力机制,以便自注意力和交叉注意力都在角分离上运行而不是像素距离。 FishRoPE 与架构无关,引入的计算开销可以忽略不计,并且自然地简化为针孔几何形状下的标准公式。我们在 WoodScape 2D 检测 (54.3 mAP) 和 SynWoodScapes BEV 分割 (65.1 mIoU) 上评估我们的结果,它在两个基准测试中都取得了最先进的结果。