论文

RH-Detect:奖励黑客检测的统一基准

RH-Detect: A Unified Benchmark for Reward Hacking Detection

模型评测基准与评测资源安全与风险评测

摘要

奖励黑客攻击是指模型在未完成预期任务的情况下利用评估信号的行为,会威胁到已部署语言模型系统的可靠性。现有数据集使用不同的标签、响应格式和元数据约定,使得检测器结果难以比较。我们提出了 RH-Detect,这是一个基准,它将来自 11 个公共数据集(包括 92,761 行和 6 个行为类别)的奖励黑客相关子集组合到一个通用模式中。在 5,021 个开放式评估单元上,每个单元包含一个任务提示和一个自由形式的模型延续,包括多轮工具使用轨迹,我们评估了来自五个家族的六个现成语言模型作为奖励黑客检测器,无需额外训练。最佳模型的合并 AUROC 为 0.962,准确率高于 93%。然而,对于四个最强的模型,在共同决策阈值下,两个多回合工具使用数据集 MALT 和 TRACE 的准确性比其他来源低 10.7-15.9 个百分点,这凸显了部署时间监控的关键差距。我们发现不同 输入格式对不同模型有不同的影响。删除思考会将 Qwen3.5-4B AUROC 从 0.779 提高到 0.849,但将 Q​​wen Flash 从 0.977 降低到 0.950。我们还评估基准作为检测器的训练数据集。依次保留每个来源,单token SFT 提高了六个保留来源中五个的平均 AUROC。 GRPO 对该故障案例的后续行动使检测性能略有提高。我们的结果表明,单个汇总分数可以隐藏数据源、检测器输入和训练程序之间的变化。