论文

RefineRL:以自我精化强化学习推进竞赛编程

RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning

模型训练强化学习RLVRAgentic RL

摘要

尽管大语言模型(LLM)在竞赛编程(CP)等复杂推理任务上展现出强大性能,现有方法主要聚焦单次尝试设定,忽视了其迭代精化的能力。本文提出RefineRL,一种旨在释放LLM在CP解题中自我精化能力的新方法。RefineRL引入两项关键创新:(1) Skeptical-Agent,一个迭代式自我精化智能体,配备本地执行工具,用CP问题的公开测试用例验证生成的解答;该智能体始终对自身输出保持怀疑态度,即使验证显示正确也强制执行严格的自我精化。(2) 一种强化学习(RL)方案,仅使用标准RLVR数据(即问题与其可验证答案的配对)激励LLM进行自我精化。在Qwen3-4B与Qwen3-4B-2507上的大量实验表明,我们的方法带来显著收益:经RL训练后,这些与Skeptical-Agent结合的紧凑4B模型不仅超越大得多的32B模型,还接近235B模型的单次尝试性能。这些发现表明,自我精化对扩展LLM推理颇具前景,具有进一步提升的巨大潜力。

RefineRL:以自我精化强化学习推进竞赛编程:论文配图
(a) 用于解决 CP 问题的怀疑代理。(b) 自改进 RL。图 1:我们的 RefineRL 方法概述。 (a) Skeptical-Agent 使用本地工具根据可见的公共测试用例评估生成的解决方案,并强制执行严格的自我改进,即使评估结果表明正确性也是如此。 (b) 自精炼强化学习利用 Skeptical-Agent 在现实世界 CP 问题数据上自行生成的精炼轨迹数据,以及新颖的 Squared 激励奖励函数,来提高 LLM 的自精炼能力。