论文
通过搜索驱动的强化学习优化奖励函数来增强 LLM 推理
Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning
摘要
数学推理是 大语言模型 的关键基准。强化学习是一种标准的 后训练 机制,用于提高 大语言模型 的推理能力,但性能仍然对驱动策略优化的奖励函数的设计敏感。本文介绍了一种搜索驱动的框架,该框架将奖励规范本身视为优化的对象。感兴趣的设置是基本模型保持固定并且奖励规范是主要的剩余设计杠杆的设置。候选奖励函数由前沿语言模型生成,自动验证,通过在具有低秩适应 (LoRA) 的 Llama-3.2-3B-Instruct 基础模型上运行的 500 步组相对策略优化 (GRPO) 训练进行筛选,并在 GSM8K 测试集上按 F1 排名。然后将前几轮的排名摘要反馈到下一轮生成中。在五轮中,搜索产生了 50 个候选奖励。平均F1从第1轮的0.596上升到第5轮的0.632,最高个人奖励达到F1 = 0.787。评估了排名最高的奖励的七种集成配置。最好的集成实现了 F1 = 0.795(95% bootstrap CI [0.756, 0.832])和准确度 0.660 [0.635, 0.686],相对于仅基础奖励的 GRPO 基线(F1 = 0.609),绝对 F1 增益为 0.19。带有 Bonferroni 校正的成对 McNemar 测试显示,所有五个或更多奖励配置在 α = 0.05/21 时在统计上无法区分。最佳集成的三种子重新训练产生的 F1 为 0.785。随机抽取的 5 奖励控制崩溃为 F1 = 0.047,这表明排名反馈循环(而不是具有更多奖励的加性信号)驱动了增益。