论文
PAGER:通过几何和关系蒸馏进行部分到全局对齐
PAGER: Partial-to-global Alignment via Geometric and Relational Distillation
摘要
预训练的 3D 编码器通常是在以一致的世界坐标系表示的全局重建场景上开发的,而具体系统必须根据相机坐标中的部分、依赖于视点的观察进行推理。我们表明,从全局学习的 3D 特征空间到现实的部分观察的这种转变暴露了严重的表示不匹配,我们在代表性的最先进的编码器(包括奏鸣曲和协奏曲)中一致发现了这种不匹配。具有全局线性探针的冻结 Sonata 编码器在整个 ScanNet 场景上达到 72.47 mIoU,但在单帧相机坐标输入上达到 2.57 mIoU。免训练重力对齐将性能恢复至 41.64 mIoU,表明坐标系不匹配是性能下降的主要来源,但仅通过规范化无法完全解决。我们引入了 PAGER,这是一种无标签适应方法,仅使用成对的部分/全局几何结构将部分视图特征与冻结的全局 3D 语义空间对齐。它学习轻量级适应模块,同时保持预训练编码器和全局分段探针冻结。匹配点特征对齐将部分特征锚定到其全局对应特征,而关系监督则保留其相对于全局表示的相似结构。全局几何仅在训练期间提供监督。推理直接对部分观察进行操作。在没有部分视图标签的情况下,PAGER 在 Sonata 和 Concerto 上都优于标签监督的 PEFT,并且在零样本 ScanNet$\rightarrow$ScanNet++ 传输中超过了完全微调的 Sonata($53.93$ vs.\ $48.09$ mIoU),这表明保留冻结的全局表示可以改善跨数据集传输。