论文

适配器丛林:分割 RLVR 预算胜过集中预算

Adapter Thickets: Splitting an RLVR Budget Beats Concentrating It

模型训练强化学习

摘要

对采样完成的多数投票是测试时计算扩展的主力,而具有可验证奖励的强化学习(RLVR)是使每个完成更好的主力。标准管道由两者组成:使用 RLVR 训练一项策略,然后对其进行多次采样并投票。我们证明这种组合是有损的。投票只能推翻选民不认同的错误,而 RLVR 会强化政策,使其样本越来越多地犯同样的错误。每种方法都准确绘制每个问题的 $160$ 完成结果,在完整的 RLVR 预算上训练单个 LoRA 适配器可以提高我们测试的每个模型 ($1.5$B-$8$B) 的单样本准确性。然而,在四个模型中的三个上,它使多数票数低于未经训练的基本模型,最多 $4.8$ 点。损害是在训练期间累积的:投票者错误的相关性稳步增加,大多数投票准确率在下降最多 $7.0$ 点之前就达到峰值。原因在于注意力,而不是 RLVR 本身。我们将相同的数据和训练预算分配给 $K$ LoRA 适配器,每个适配器都在自己的随机不相交分片上进行训练,并将结果称为适配器丛林。在所有 $16$(模型,$K$)设置中,灌木丛投票淘汰经过充分训练的适配器,对于 $K{\geq}4$,它们停留在基本模型的 $0.8$ 点内或之上。单个适配器按照灌木丛成员的步数提前停止,是与小型 $K$ 的灌木丛相匹配的强大控制。对于 $K{\geq}8$,丛林保留了更多 RLVR 的单样本增益,并在八个设置中的六个中击败了该控制。集中的成本也随着投票数量的增加而增加:从 $16$ 到 $160$ 投票,灌木丛相对于经过充分训练的适配器的领先优势从 $1.3$ 扩大到 $3.3$ 点。当计划进行抽样和投票时,RLVR 预算最好广泛使用而不是深度使用。