论文
将接近最优的 SFT-RL 注释预算分配从小到大缩放 LLM
Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs
摘要
如何在 LLM 后训练 期间在监督 微调 (SFT) 和强化学习 (RL) 之间划分固定注释预算仍然是一个悬而未决的问题。现有的工作仅描述了广泛的趋势(例如,SFT 在低数据情况下占主导地位),缺乏原则性的分配框架,并且没有检查最佳比率是否跨模型大小转移。我们用近乎最优的方式来构建这个问题:我们不是寻求单一的最优 SFT-RL 比率,而是描述近乎最优的区域,即在指定的峰值性能容差内的一组分配。根据经验,即使对于小公差 (2-10%),该区域也很宽,并且随着模型规模的扩大而变宽,并且可以可靠地从小型代理模型转移到大型目标模型。这产生了一个实用的策略:小型代理模型实验足以识别可转移的近乎最佳区域,从而消除了详尽的大规模搜索的需要。我们的结果在任务、模型系列以及基于偏好的 离策略 和奖励监督 同策略 RL 方法中保持一致。我们进一步分析 SFT 和 RL 数据之间注释成本的不对称如何改变近乎最优的区域。