论文

无标签引导:将测试时强化学习压缩为仅偏差子空间

Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces

模型训练参数高效训练

摘要

测试时强化学习 (TTRL) 使模型能够在不依赖标记训练数据的情况下改进推理,但现有方法通常会优化大部分模型参数。这就提出了一个自然的问题:当奖励信号和优化空间都受到严格限制时,有效的测试时间适应能否出现?我们用无标签的仅偏差 TTRL 来回答这个问题,它使用多数票伪标签作为奖励,并仅优化大约 100K 偏差参数,同时保持预训练的主干网络冻结。在 MATH-500 上,我们的方法达到了 76.67% 的准确度,略高于我们自己标记的偏差控制再现,同时优化的参数比全参数 TTRL 少了 76,000 倍。相同的训练过程可以提高视觉语言和音频推理任务的性能,包括 MathVista、AI2D、LogicVista 和 MMAU。我们进一步表明,学习到的引导向量转移到了 4,500 个保留的数学问题,这表明适应并不限于测试时优化期间使用的问题。最后,我们分析了为什么这种高度受限的适应能够发挥作用,表明多数投票的可靠性随着采样轨迹的一致程度而提高,并且具有更大可访问梯度能量的偏置子空间表现出更强的下游可训练性。这些结果表明,使用完全无标签的奖励来优化微小的仅偏差子空间可以产生大量的测试时间适应。