论文

点云视频的三效迁移学习

Tri-Efficient Transfer Learning for Point Cloud Videos

模型训练参数高效训练

摘要

虽然点云基础模型具有显着先进的点云视频理解能力,但现有的参数高效 微调 (PEFT) 方法仍然面临两个关键限制:大规模点云数据集的标注成本过高和严重的内存瓶颈。在本文中,我们的目标是从现有数据中挖掘更丰富的监督信号,而不是盲目扩展数据集。另一个关键原则是,与完整的 微调 相比,微调 的内存占用必须大幅减少,这对于当前的 PEFT 技术来说仍然难以实现。在这些挑战的推动下,我们确定了三个核心需求:数据效率、参数效率和内存效率,并提出了 PoinTriE,这是一个在所有三个维度上都表现出色的统一框架。对于 预训练,伪运动轨迹是通过刚性变换合成的,并与文本语料库和源自原始点云的 2D 投影配对。然后,我们提出了一种通过多模态对比学习、刚性旋转预测和运动分布发散进行优化的几何运动对偶网络,以产生密集的自我监督。在 微调 期间,我们冻结了预训练的主干网,仅更新使用 LoRA 单元构建的轻量级时空侧网络。 PoinTriE配备了梯度流掩蔽策略,同时减少了内存消耗和参数开销。大量实验证实,PoinTriE 在动作识别和语义分割任务上建立了新的最先进的结果。