论文
RA-RFT:通过检索增强强化微调学习类比推理
Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
摘要
检索增强生成通常通过外部知识约束语言模型,但词汇或语义相似度不足以找到复杂推理任务所需的示例:语义相似的问题可能需要不同的解法,表面不同的问题却可能共享推理模式。RA-RFT是一种教授类比推理的后训练框架。它使用标准相关性蒸馏训练检索器,按预期推理收益而非语义重叠排序,再结合检索到的类比示例进行强化微调,使策略模型在可验证结果奖励下学会利用推理轨迹。对检索上下文多样性的分析显示,推理感知检索能找到互补的解题策略。在多项高难度数学基准上,RA-RFT持续优于标准强化微调;在AIME 2025上,Qwen3-1.7B和Qwen3-4B的average@32准确率分别比GRPO提高7.1和2.8个百分点。这表明推理感知检索可以补充奖励设计与训练课程的改进。