论文

TTPO:测试时策略优化

TTPO: Test-Time Policy Optimization

模型训练强化学习

摘要

最近著名的 后训练 方法,例如强化学习 (RL) 和 同策略 Self-蒸馏 (OPSD),推动了 大语言模型 数学推理的快速进展,但它们对 真值 标签的依赖阻碍了测试时训练 (TTT)。用多数票伪标签替换 真值 是一种自然的选择,但它很脆弱:不正确的投票会腐蚀老师并误导每个标记。我们观察到这种失败模式是不对称的:无论投票本身是否正确,与伪标签不一致的采样轨迹通常都是错误的。基于这一观察,我们提出了测试时策略优化(TTPO),这是一种非对称目标,通过 OPSD 提炼出一致的采样轨迹,并通过分组 RL 惩罚不一致的采样轨迹。 词元级 选择进一步细化了两个分支:蒸馏 降低了已经收敛的位置的权重,而 RL 仅惩罚置信错误。即使在频繁出现伪标签错误的情况下,这两种更新仍然有充分的依据,并且随着模型的改进,多数投票路由会产生更严格的自我监督。在没有任何标签的情况下,TTPO 在五个竞赛级基准上与标签监督的 OPSD 相匹配,将 Qwen3-1.7B 在 TTT 中从 38.0% 提高到 45.2%,无需思考,收益率 +25.2% 到 +36.4%,并表现出强大的跨任务泛化能力。