论文

哪些预训练和训练中可以从奖励中学习?

What Pretraining and Midtraining Make Learnable from Rewards?

模型训练强化学习

摘要

奖励可以识别正确的答案,同时使新输入所需的计算未确定。我们研究预训练和训练中如何提供使奖励适应有效的信息和计算。在顺序状态计算和上下文记忆中,我们描述了对每个训练奖励都达成一致但要求不同的保留答案的机制。独立于任务的源观察解决了这种歧义。我们通过相同参数中的源预测和奖励适应,从指定的随机初始化构建有限采样的 Adam 路径,证明预测如何获得执行或检索以及奖励如何学习其特定于任务的用途。使用预训练的 Qwen2.5 检查点进行的实验测试了这种分工。在八个世界中,经过正确源和首次操作监督训练的顺序模型取得了 82.61% 的成功率,而私有随机源控制的成功率为 44.15%。记忆重放在奖励适应过程中保留了检索,独立的八世界确认实现了 75.32% 的任务成功率,而匹配的替代检索训练后则为 49.86%。 GSM8K 和 HotpotQA 分别区分奖励输入、后续增益和最终表现的准确性。这些结果将信息获取、可执行计算和奖励引导的任务学习联系起来。