论文
RepSAM:通过表示引导适应将基础模型与机器人视觉联系起来
RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation
摘要
尽管 SAM 等基础模型具有零样本能力,但非结构化环境中的机器人感知仍然具有挑战性。这项工作将性能下降归因于 Transformer 层之间的非均匀表示变化:浅层表现出巨大的域间隙(CKA < 0.5),而深层则有效传输(CKA > 0.7)。基于这一观察,我们提出了 RepSAM,一种表示引导的参数高效 微调 (PEFT) 框架,用于使基础模型适应机器人视觉。 RepSAM 采用基于理论的 CKA 引导的秩分配策略,结合多模态融合模块,可以稳健地处理具有挑战性的机器人场景,包括透明物体和杂乱场景。对六个基准和机器人操作任务的实验评估表明,RepSAM 实现了 微调 全部性能的 97.9%(89.0% vs. 90.9% mIoU),同时将可训练参数减少了 158 倍(从 632M 到 4.0M)。在单个 A100 GPU 上仅进行 4 小时的训练,RepSAM 的性能就比 DoRA 高出 7.9% mIoU(比完整的 微调 减少了 96 倍,需要 384 个 GPU 小时)。这些改进具有统计显着性 (p < 0.01),并且与 LoRA (RGB) 基线相比,机器人操作成功率绝对提高了 12.0%。