论文
Hi-TTRL:通过测试时强化学习的提示来调节共识
Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning
摘要
测试时强化学习(TTRL)通过使用多数投票构建的伪标签更新策略,提高了 大语言模型 在没有标签数据的情况下的推理能力。虽然有效,但多数投票分配的奖励信号对共识强度高度敏感,共识强度定义为采样轨迹组内最常见答案的频率。在TTRL中,共识强度起着双重作用:它既反映了伪标签的可靠性,又反映了优势的分布。低共识可以通过不成比例的大优势来放大不可靠伪标签的更新,而高共识会降低奖励对比度并最终产生梯度消失。在本文中,我们介绍了 Hi-TTRL,这是一种测试时强化学习框架,它利用采样期间的提示来调节采样答案共识强度。 Hi-TTRL 首先估计部分采样轨迹组的共识强度。当共识强度超出目标区间时,它会调用马尔可夫链蒙特卡罗 (MCMC) 提示采样器。采样器以幂变换前缀分布为目标,并使用有限步近似采样来生成转出前缀作为提示。通过调整功率指数,Hi-TTRL 会生成带有锐化或平坦化的幂变换目标的提示,将采样答案共识强度引导至目标区间。对多个数据集和主干网的实验表明,Hi-TTRL 始终优于标准 TTRL,并通过消融和共识引导分析验证了自适应提示引导共识调节的有效性。