论文

PTH检查RL比较Harness

Probe the Harness: Setup Checks for Stale-Data RL Comparisons in Language Models

模型评测评测方法与指标

摘要

在陈旧样本上训练语言模型的方法,通过与重要性校正基线的比较来评判。我们展示实验Harness的细节可以逆转观察到的排名,并提出PTH(探查Harness)——一套使Harness可见的检查。我们的案例是SAN(无行为修正的方法)与截断重要性采样(TIS)在verl和一个单GPU训练器上的比较:起初SAN在两个栈中都先完成。四个Harness细节改变了这一比较:PPO比率相对学习器自己重算的概率取值;数据种子没有传到TIS臂;回放队列把第一批复用33次更新;两个损失归一化器与其描述不符。每种情况下日志量看起来都与正常工作一致,而定义该比较的量未被检查。检查Harness后,TIS在verl上与SAN持平,而在训练器中TIS稳定学习、SAN保持领先。我们贡献每个细节的特征及其对比较的影响、TIS与未校正GRPO在采样器滞后下的参考结果,以及PTH检查清单。