论文
HackProbe:不依赖宿主Agent的奖励投机检测与防护
Harness-agnostic detection and immunization of reward hacking in self-evolving language models
摘要
自演化语言模型通过提出候选更新并保留能提升可见评分的版本来改进。当该评分并非实际能力的准确代理时,持续选择会拉大评分与真实能力之间的差距,即奖励投机。我们提出HackProbe,一种可插入任意自演化循环的监控器,通过两个黑盒钩子实现,无需访问权重或激活值。它维护一个秘密的、分布固定的比较核心,其冻结分布确保各代间的代理能力可比性,同时配备一个旋转的全新层,以抵御协同适应。基于该代理构建了四项测试,涵盖能力差距、与在线变化点检测对齐的尺度偏差、能力停滞以及条件置信错误率;通过Sidak校正,将这些测试转化为校准的全家族p值。仅诊断无法恢复任何内容,因此引入一种风险感知的免疫层,从候选池中重新选择诚实的更新方案,利用核心代理和纯粹的结构化作弊痕迹,每代最多向主机披露log2 Pi比特信息。我们证明了可检测性边界,将目标错误率转化为明确的探针规模预算,并界定探针旋转带来的增益与局限。在包含四个注入黑客通道且有真实标签的受控提示级别主机上,HackProbe达到0.763的AUROC,优于最强基线的0.663,将误报率从0.706降至0.434。其带带宽限制的重新选择是唯一在黑客场景下能提升真实能力(平均提升5.2分)超过清洁运行中损失能力(平均损失4.7分)的免疫层级;各通道效应大多不具显著性。