论文
用于反射感知自监督表示学习的镜像融合注意力
Mirror-Fusion Attention for Reflection-Aware Self-Supervised Representation Learning
摘要
大多数自监督学习(SSL)方法鼓励增强过程中的不变性,但严格的翻转不变性可以抑制大约双边数据(例如医学图像和人脸)中信息丰富的左右对应关系。我们提出了镜像融合增强自监督学习(MFASSL),这是一种 Vision Transformer 框架,它将软反射先验注入到标准 SSL 中,而无需重新设计主干。 MFASSL 构建与估计对称轴对齐的镜像配对视图,并引入轻量级镜像融合注意 (MFA) 模块,用于镜像区域之间的自适应 词元级 交互,同时保留不对称线索。基本 SSL 目标进一步与反射一致性和中间层词元对齐损失相结合。在 CheXpert、BraTS、CelebA-HQ 和 WFLW 中,MFASSL 在匹配的 ViT-B/16 设置下比 MoCo-v3、DINO 和 MAE 基线提高了下游性能、校准和反射鲁棒性。与最近的等效 SSL 方法相比,它还获得了更强大、更一致的增益,仅需要大约 2.7\% 的额外参数。这些结果表明,轻量级几何感知先验可以有效补充基于不变性的 SSL。