论文

通过多数投票来检测和减轻测试时强化学习中的正确答案消退窗口

Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement Learning with Majority Voting

模型训练强化学习

摘要

测试时强化学习 (TTRL) 报告使用多数投票作为伪标签信号在数学推理基准上显着提高了准确性。我们认为这些成果被系统性地误解了:大多数反映了对已经可以解决的问题的尖锐化,而不是真正的学习,而从正确到不正确的问题的数量超过了真正学到的问题,而且一旦多数票锁定了错误的答案,这种损害是不可逆转的。每个问题的跟踪表明,低能力问题中的正确答案信号在被永久抑制之前会短暂活跃,我们将这种现象称为\textit{正确答案消退窗口},以翻转率(FR)作为其主要指标。因此,我们提出了 TTRL-Guard,一个轻量级框架,具有针对灭绝窗口的三种机制:翻转率感知奖励缩放(FRS)随着 FR 的下降而降低风险更新的权重,少数保留采样(MPS)保留来自少数正确答案的梯度信号,风险条件稀疏更新(RCSU)暂停对极化问题的更新。三个模型和四个基准测试的实验表明,TTRL-Guard 在 Qwen2.5-7B-Instruct 和 Qwen3-4B 上实现了最佳平均 pass@1,在 AIME 2025 上相对于 TTRL 提高了 +54%。