论文

便宜的 奖励作弊 检测

Cheap Reward Hacking Detection

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

一个小型 Transformer 编码器经过训练,可将 Terminal-Wrench 轨迹映射到单位球体上,其中嵌入距离近似于奖励和元数据信号之间的 $L_1$ 距离。该嵌入之上的线性探针在清理后的测试分割上检测到 奖励作弊,AUC $0.9467$ 和 TPR@5%FPR $0.8296$,与 TW 消毒的 LLM-as-judge AUC(清理后的分割上的 $0.9510$)相匹配,并超过其 TPR@5%FPR($0.7130$ vs $0.8296$)在相同的信息条件下,每条轨迹的成本大约低四个数量级。编码器不是纯粹的行为读取器:在探测时从其输入中剥离自然语言推理会将 AUC 降至 0.6213。