论文
SupGRPO:通过用于文本识别的基于匹配的在线 SFT 增强 GRPO
SupGRPO: Enhancing GRPO with Matching-based Online SFT for Text Spotting
摘要
文本识别需要准确的文本识别和精确的空间定位。目前的专用文本检测识别模型擅长预测自然场景中的紧密边界框,但在复杂或艺术文本上表现不佳,而多模态 大语言模型 (MLLM) 拥有强大的识别能力,但在定位方面仍然较弱。为了使文本识别器具有通用且强大的识别能力并最大化其定位能力,我们探索了两种基于MLLM的微调方法:监督微调(SFT)和基于组相对策略优化(GRPO)的强化学习微调。一个有趣的发现是,SFT 在增强识别方面不如 GRPO 有效,而 GRPO 在增强检测方面不如 SFT 有效。为了弥补彼此的缺点,我们引入了联合训练策略 SupGRPO,它同时使用 SFT 和 GRPO 来优化模型。 SupGRPO采用专门设计的奖励功能,并开发了一种基于匹配的在线SFT,专门用于协调词元。它既缓解了 GRPO 的奖励稀疏问题,又避免了 SFT 的实例顺序依赖问题。为了评估特别具有挑战性的案例,我们策划了 ATS,一个用于艺术文本识别的数据集。实验表明,SupGRPO 改善了文本识别和检测,并获得了卓越的性能。我们的代码和数据集将在 https://github.com/Psycho-9/SupGRPO 发布。