论文
外推权重平均揭示了代码 RL 中的正确性-效率边界
Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL
摘要
微调检查点之间的线性插值已被证明可以追踪竞争目标之间的帕累托前沿,但外推权重平均是否可以将此类前沿扩展到在推理时有用的新检查点,而无需额外的 RL 训练,仍不清楚。我们在 RL 中研究这个问题以进行竞争性编程,其中时间和内存限制下的隐藏单元测试强制执行功能正确性和计算效率。从共享初始化开始,我们在嵌套单元测试覆盖范围下训练检查点:低覆盖率奖励需要通过较小输入的测试,而高覆盖率奖励需要通过逐渐更大的测试直至整个套件。这次扫描揭示了正确性-效率边界的出现:在困难问题上,较高的覆盖率奖励减少了优化失败,但增加了正确性失败,使解决率几乎保持不变。低覆盖率和高覆盖率检查点之间的插值可以恢复该边界,而外推法则将其扩展到经过训练的端点之外。边界及其外推延续都出现在三种推理设置(纯推理、工具使用和主体编码)以及两个模型尺度(32B 和 7B)中。在问题层面,沿着边界移动会改变问题的解决方式,使推断的检查点成为推理时间扩展中的补充策略。具有外推权重平均的集成扩大了覆盖范围,并将 LCB/hard 上的 pass@250 比匹配样本预算的最佳单个检查点提高了 3.3%。这些结果表明,代码 RL 中的嵌套单元测试覆盖范围引入了外推权重平均可以导航、扩展和利用的前沿。