论文
巩固 LLM 后训练 的奖励扰动
Consolidating Rewarded Perturbations for LLM Post-Training
摘要
语言模型的 后训练 通常被构建为通过梯度下降实现的样本分数更新循环。最近的一项工作(以 RandOpt 为代表)将这个循环重新定位到权重空间,对预训练模型周围的高斯扰动进行采样,并在推理中集合了前 K 个奖励专家。虽然在匹配的训练计算下与 PPO 和 GRPO 竞争,但这种预测级集成会导致每个测试示例进行 K 次前向传递,并且不能完全扩展到自由形式生成。我们询问是否可以将奖励群体折叠成一个可部署的模型,用一个综合更新取代推理时间集成。对 25 个模型-任务对的分半分析揭示了每种情况下可重复的低秩结构。我们将这种几何图形转化为 CoRP(Consolidating Rewarded Perturbations),这是一种无梯度算子,它结合了奖励加权聚合、兼容性感知重新加权和保留验证门,并且没有梯度流过语言模型。在从 0.5B 到 8B 的五种语言模型以及涵盖数学、代码和创意写作的五种任务中,CoRP 平均将基础模型提高了 8.1 分。使用 RandOpt 扰动预算的十分之一,CoRP 超过单推理 RandOpt 6.5 个点,并在每个测试示例一次前向传递时恢复了 50 次多数投票集成的一半以上增益。