论文

PointRFT:用于点云小样本学习的显式强化 微调

PointRFT: Explicit Reinforcement Fine-tuning for Point Cloud Few-shot Learning

模型训练强化学习

摘要

了解点云中的空间动力学和语义是全面理解 3D 的基础。虽然组相对策略优化 (GRPO) 等强化学习算法最近通过战略奖励设计激励推理能力,在 大语言模型 中取得了显着的突破,但它们在 3D 感知领域的潜力在很大程度上仍未得到开发。这自然提出了一个关键问题:基于强化学习的方法能否有效赋能3D点云微调?在本文中,我们提出了 PointRFT,这是第一个专门为点云表示学习量身定制的强化 微调 范式。我们选择三种流行的 3D 基础模型,并设计专门的准确性奖励和分散奖励函数来稳定训练并减轻分布变化。通过比较不同训练范式的全面的少样本分类实验,我们证明 PointRFT 在不同的基准测试中始终优于普通监督 微调 (SFT)。此外,当有机地集成到混合预训练-SFT-RFT范式中时,点云基础模型的表示能力得到充分释放,特别是在数据稀缺的场景下,实现了最先进的性能。