论文
CoRE:面向测试时强化学习的均衡式共识奖励
CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning
摘要
在无标注测试数据上,强化学习缺乏真值奖励;测试时 RL 方法从模型自身的 rollout 中推导奖励,奖励那些与对 N 个采样答案的多数投票相匹配的 rollout。该投票在正确答案是少数时将其丢弃,并对每个与多数匹配的 rollout 打出相同的分数。我们用 CoRE(Consensus Rewards via Equilibrium)取代它:N 个 rollout 构成一个图,其边融合答案一致性、推理相似性和生成置信度,复制者动力学提取其主导集合,产生精炼的伪标签、分级逐 rollout 奖励和逐问题内聚性门控。CoRE 严格推广了投票:多数投票作为特例被恢复;块值分析给出了共识何时能在更大的错误多数面前恢复正确少数的锐利阈值;且可以证明置信度校准能以乘性方式降低该阈值。在七个骨干和五个基准(42 个模型-基准单元,每个三种种子)上,CoRE 相对未训练基础模型平均提升 +21.7 分,而多数投票 TTRL 为 +20.4;凡一致性存在争议之处 CoRE 均胜出,对投票的优势最高达 +7.5 分,并以减少 54-70% 的步数达到投票基线的平台准确率。共识而非计票:将 rollout 群体视为图而非投票箱,把脆弱的投票变成校准的、分级的、自监督的奖励,且不增加任何 rollout 成本。
