论文
Falcon Perception-HD:通过强化学习实现高密度感知
Falcon Perception-HD: High Density Perception via Reinforcement Learning
摘要
在开放词汇设置下训练定位视觉实体的自回归感知模型大多使用监督 微调 (SFT) 进行最大似然训练,但它优化了代理目标(每个词元交叉熵),该目标与精度和召回等感知指标根本不一致。在本文中,我们探索 后训练 强化学习(RL),特别是 GRPO,以直接将这些模型与其评估指标对齐。在最近推出的 Falcon Perception 的基础上,我们设计了一个 RL 框架,用于解决特定于感知的挑战:针对集合结构输出和多头采样控制的奖励设计。我们发现 RL 对感知有多种好处:首先,RL 在非常密集的场景(每个场景最多 500 个物体)中解锁了最先进的性能,在这种情况下,大多数现有系统都会急剧退化或崩溃;此外,它还修复了自回归感知模型中的常见问题,例如掩模重复,并且几乎完全消除了对 NMS 和协调重复数据删除的需要,从而提高了性能和效率,并消除了对超参数调整的需要;总体而言,我们注意到引用表达分割(在 PBench 和 SACO-Gold 上)的各个难度都得到了改善,并且我们找到了一种优雅的方法来保留对象是否存在的知识(由 MCC 评估),而无需对负样本进行训练。我们证明,惩罚假阴性和阳性的简单奖励就足够了。我们开发了两种混合自注释管道,分别针对困难的指代表达和非常密集的场景量身定制,并展示了它们在强化学习训练中的优势。模型权重作为 Falcon Perception 修订版发布~\footnote{https://huggingface.co/tiiuae/Falcon-Perception}。数据集将被发布。