论文
RefineRL:以自我精化强化学习推进竞赛编程
RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning
摘要
尽管大语言模型(LLM)在竞赛编程(CP)等复杂推理任务上展现出强大性能,现有方法主要聚焦单次尝试设定,忽视了其迭代精化的能力。本文提出RefineRL,一种旨在释放LLM在CP解题中自我精化能力的新方法。RefineRL引入两项关键创新:(1) Skeptical-Agent,一个迭代式自我精化智能体,配备本地执行工具,用CP问题的公开测试用例验证生成的解答;该智能体始终对自身输出保持怀疑态度,即使验证显示正确也强制执行严格的自我精化。(2) 一种强化学习(RL)方案,仅使用标准RLVR数据(即问题与其可验证答案的配对)激励LLM进行自我精化。在Qwen3-4B与Qwen3-4B-2507上的大量实验表明,我们的方法带来显著收益:经RL训练后,这些与Skeptical-Agent结合的紧凑4B模型不仅超越大得多的32B模型,还接近235B模型的单次尝试性能。这些发现表明,自我精化对扩展LLM推理颇具前景,具有进一步提升的巨大潜力。
