论文
代码生成中测试时强化学习的熵正则化等级屏蔽策略优化
Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation
摘要
现有的测试时强化学习(TTRL)方法通过对具有规范答案的未标记测试时任务的答案级自投票来获得奖励,但这对于代码生成来说是失败的,因为程序无法通过表面形式进行比较,因此不能直接提供可用的训练信号。为了使 TTRL 适用于代码生成,我们提出了探针驱动的 TTRL,它从问题陈述中构造无输出的探针输入,在这些探针上执行候选程序,并根据所得的行为协议定义探针共识奖励(PCR)。 PCR 为开放词汇程序提供了行为训练信号,但它不是完全可靠的验证器,并且仍然容易通过虚假共识而受到 奖励作弊 的影响。因此,我们引入了熵正则化排名屏蔽策略优化(ERPO),它通过排名屏蔽将低 PCR 转换为保守的负更新,并通过熵上限控制策略漂移。在编码基准上,ERPO 在域内自适应和零样本传输方面都显着改进了 pass@1 和 pass@k。