论文

LLM什么时候可以在弱监督下学会推理?

When Can LLMs Learn to Reason with Weak Supervision?

模型训练强化学习

摘要

大语言模型 通过具有可验​​证奖励的强化学习 (RLVR) 实现了显着的推理改进。然而,随着模型能力的增强,构建高质量的奖励信号变得越来越困难,因此了解 RLVR 何时能够在较弱的监督形式下取得成功至关重要。我们在三种弱监督环境下对不同的模型系列和推理领域进行了系统的实证研究:稀缺数据、噪声奖励和自监督代理奖励。我们发现泛化受到训练奖励饱和动态的控制:泛化的模型表现出一个延长的预饱和阶段,在此期间训练奖励和下游性能一起攀升,而快速饱和的模型会记忆而不是学习。我们将推理 忠实性 定义为中间步骤在逻辑上支持最终答案的程度,作为预测模型落入哪个状态的预强化属性,而输出多样性本身并不能提供任何信息。受这些发现的启发,我们理清了连续 预训练 和监督 微调 的贡献,发现显式推理轨迹上的 SFT 对于弱监督下的泛化是必要的,而领域数据上的连续 预训练 放大了效果。这些干预措施一起应用于 Llama3.2-3B-Base,可以在基础模型之前失败的所有三种设置中进行泛化。