论文
ThinkTwice:联合优化大语言模型的推理与自我精炼
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
摘要
我们提出ThinkTwice,一个基于群组相对策略优化(GRPO)的简单两阶段框架,联合优化LLM求解推理问题与精炼答案。在每一对训练步中,ThinkTwice先优化模型求解推理问题,再优化其精炼自己对同一问题的解答,两个阶段使用相同的二值正确性奖励,无需正确性信号或批评标注。在五个数学推理基准以及包括Qwen3-4B和Olmo3-7B在内的两个模型家族上,ThinkTwice相比有竞争力的在线策略优化基线,显著提升了推理与精炼两方面的表现。具体而言,以pass@4衡量,在Qwen3-4B上,ThinkTwice在AIME上精炼前领先GRPO 5个百分点,经一步自我精炼后领先11.5分。对ThinkTwice训练动态的分析揭示出一种隐式的“先纠错后巩固”课程:训练早期精炼以纠错为主,随着模型进步自然转向保留已正确的解答,从而产生更充分纠正的奖励信号。我们的工作将推理与自我精炼的联合训练确立为RLVR的一种有原则且有效的方法论。
