论文

监控读数非行为控制证据

A Near-Zero Monitor Readout Is Not Evidence of Behavioral Control

模型训练奖励建模与过程监督

摘要

用可验证奖励做后训练会诱发奖励黑客,这促使把监视器放进训练目标而非仅作离线审计。我们证明低监视器读数并不能识别这种干预是否控制了行为。在一个主导利用在推理轨迹起点即可用的代码生成环境中,我们针对三个通过同一离线门槛的监视器训练策略:一个域内激活探针,以及两个以策略多早提交自身最终答案为条件的惩罚。探针分从第一个记录训练步起就处于数值下限;每个前缀训练运行在终点的训练分中位数都为零。这些读数估计的量不同,我们也不比较其尺度;但在每个监视器家族内,低值都不确立行为控制。在同一固定配置内,训练分中位数同为零的前缀训练运行仅因种子不同,就从低作弊份额的混合状态一直到近乎纯奖励黑客。所有探针运行都到达作弊状态,但其下限读数反映的是探针验证位置与训练读取位置的错配,而非这种歧义的第二个实例。文本级分析识别出一种前缀失败模式:通用规划与填充外壳把利用推迟过截断点而未从最终输出中消除。低测得承诺度因此无法区分低作弊份额与对利用的延迟承诺;离线判别力与低的监视器对齐读数都不是行为控制的充分证据,需要带外行为检验。项目页:https://github.com/zhezhou1106/spoof-cost。