论文

先锐化再适配:面向测试时强化学习的无数据起始状态锐化

Sharpen Before You Adapt: Data-Free Entry-State Sharpening for Test-Time Reinforcement Learning

模型训练强化学习

摘要

测试时强化学习(TTRL)利用模型自身采样产生的监督,在没有标签的测试问题上适配语言模型。因此,检查点的起始状态至关重要:分布分散的策略会提供噪声更大的自监督,并可能将有限适配预算的大部分仅用于集中概率质量,之后才能可靠展现已有能力。我们提出起始状态锐化:在TTRL之前执行无数据训练,将通用检查点准备为后续无标签适配能更高效利用的状态。该思路不绑定某一种训练方案,不同无数据目标能将同一基础模型推向不同起始状态。在由Qwen3-4B得到的五个无数据检查点上,采用相同的15步TTRL协议评估,起始策略熵与最终转化效率这一可靠性相对可达能力的指标具有强排序相关性(Spearman $ρ=-0.90$;控制起始可达能力后为$ρ=-0.99$)。不同目标形成鲜明对比:R-Zero仍较分散,熵为$3.39$ nats,在MATH、GPQA和AMC的6/6组匹配比较中最终均低于未调优基础模型;SPIRAL的熵达到$0.07$ nats,尽管自博弈阶段未使用数学训练数据,却在MATH和GPQA上取得最高TTRL后准确率。领域内无标签自蒸馏干预进一步表明,起始状态可以被主动锐化。这些结果支持将检查点准备视为状态控制问题:用无数据训练改善TTRL准备程度,以起始熵作为无标签控制信号,并以可达能力为约束。