论文

CDPM:以DINOv3几何一致微调进行跨模态配准

Geometry-Aligned Semantic Matching for Cross-Modal Planar Image Registration

模型训练监督微调与指令调优

摘要

跨模态图像匹配为平面配准建立稳定准确的几何对应。语义表示有跨模态一致性,但语义相似不必然意味着几何对应;细粒度CNN提供局部细节,却缺少稳定细化所需全局语义指导。我们提出CDPM,先建立几何一致语义表示,再在精细定位中保持其主导作用。通过几何一致跨模态patch对逐步适应DINOv3,使相似度更好反映真实空间对应。DINO主导特征金字塔利用多尺度DINO保持对应,以轻量CNN提供精确局部细化的辅助结构细节。三组跨模态数据实验显示优势。VIS-IR上,相比稠密匹配器RoMa,AUC@3/5/10/20分别提高7.36、13.40、13.75和10.42个百分点,mACE从5.83降至2.78像素。相对RoMa v2,全部指标更优且FLOPs少45.6%。在线演示和数据集已可用,代码将发布于 https://warren-wzw.github.io/CDPM/.