论文
LLM 能否在嘈杂的监督下学会稳健推理?
Can LLMs Learn to Reason Robustly under Noisy Supervision?
摘要
具有可验证奖励的强化学习(RLVR)可以有效地训练依赖于丰富的完美标签的推理模型,但由于专家稀缺,它对不可避免的噪声标签的脆弱性仍然未被充分研究。在这项工作中,我们朝着系统分析 RLVR 中的噪声标签机制迈出了第一步。与监督分类相反,大多数 RLVR 算法都包含基于 rollout 的条件:标签对训练的影响取决于当前策略是否可以生成实现它的 rollout,这一特性自然会扩展到噪声标签。基于这一观察,我们区分了两种类型的噪声:不活跃的噪声标签,它会降低数据效率;以及活跃的噪声标签,它们会被强化,并有使模型偏向不正确分布的风险。从使用噪声样本训练的实验中,我们发现了一种早期正确性一致性现象:尽管噪声样本在后期开始落后,但在早期训练中,干净样本和噪声样本的准确性都有类似的提高。受这种动态的推动,我们提出了在线标签细化(OLR),当满足两个条件时,它会逐步纠正具有多数投票答案的潜在噪音标签:多数答案的采样轨迹通过率呈正斜率,并且更新之间具有稳定的历史一致性,从而随着策略的改进能够逐步进行自我纠正。我们在六个分布内数学推理基准(AIME24/25、AMC、MATH-500、Minerva 和 Olympiad)和三个分布外任务(ARC-c、GPQA-diamond 和 MMLU-pro)上评估 OLR。在噪声比从 0.1 到 0.9 的范围内,OLR 持续提高了非活动和活动噪声标签设置下的鲁棒性,在分布内基准上实现了 3.6% 到 3.9% 的平均增益,在分布外评估上实现了 3.3% 到 4.6% 的平均增益。