论文
SVR-R1:强化学习中以自验证引导多模态推理
SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
摘要
我们提出自验证推理者(SVR-R1):一个多轮RL框架,把模型自身的验证变成多模态推理的学习信号。对每个查询,模型用同一组权重提出答案并给出二元自裁决(是/否):答“否”触发二次重想;答“是”或达到轮次上限则定稿输出、计算基于结果的奖励。SVR-R1以GRPO与异步多轮rollout框架实现,无需外部监督或辅助评论家。我们在视觉语言推理基准上评估SVR-R1:相较强标准GRPO基线大幅提升准确率。训练动态显示对验证的依赖递减——验证轮次更少但测试准确率更高——表明随着策略内化自校正并经框架选择最有信心的答案,验证与生成之间的差距收窄。SVR-R1衔接了VLM的推理时自精炼与RL训练这块较少探索的交叉地带,为引导多模态推理提供简单有效的配方。我们将开源SVR-R1以促进VLM后续研究。
