论文

通过几何奖励积分分配强化 Point-VLM 中的 3D 理解

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

模型训练强化学习

摘要

点视觉语言模型有望赋予实体代理可执行的空间推理能力,但它们经常屈服于几何幻觉,其中预测的 3D 结构与观察到的 2D 现实相矛盾。我们认为这种失败的关键原因不是表示瓶颈,而是强化学习中的结构失调,其中稀疏的几何标记被噪声和广播的序列级奖励淹没。为了解决这种因果稀释问题,我们提出了几何奖励贡献分配,这是一个框架,它将整体监督分解为特定字段的信号,并将它们专门路由到其负责的词元范围。该机制将模糊的反馈转化为精确的梯度更新,并有效地将通用策略优化转化为有针对性的结构调整。此外,我们通过重投影一致性项将物理约束内化,该项作为跨模式验证器来惩罚物理上不可能的几何形状。我们的方法在源自 ShapeNetCore 的校准基准上进行了验证,通过将 3D KPA 从 0.64 提高到 0.93、将 3D 边界框交集与并集的交集增加到 0.686、将重投影一致性分数提高到 0.852,弥补了可靠性差距。至关重要的是,这些成果是在保持强大的 2D 定位性能的同时实现的,标志着从合理的文本输出到物理可验证的空间预测迈出了有意义的一步。