论文

强化学习后训练的计算预算如何分配:模型、搜索、学习与反馈

Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback

模型训练强化学习

摘要

强化学习后训练被用于基础模型推理、规划及反馈驱动的机器人学习,但受限资源常被概括为一个总FLOP预算。论文研究相同预算下如何选择更大策略模型、更长时间训练较小模型、更多轨迹搜索或更强奖励反馈。作者提出GRPO计算核算框架,将消耗拆分为轨迹采样与搜索、策略更新与学习、奖励或反馈模型评估。 在使用LoRA适配的Qwen2.5策略上,观测到的最佳分配取决于模型规模、预算、奖励系统和评估目标。相同FLOP预算下,模型选择与训练分配相互影响:大模型每个词元计算更多,因此只能完成较少更新或采样。基于规则的奖励将几乎全部非更新计算用于策略采样,过程奖励模型式反馈则需把一部分预算用于奖励模型推理。论文提供RACE作为小规模网格诊断协议,用于昂贵验证前识别预算分配状态,并不保证留出评测改善。作者建议同时报告总FLOP及模型大小、搜索、学习和反馈之间的计算分配。