论文

HACKTRACE奖励黑客行为监督

hacktrace: behavior-supervised detection of reward hacking during code generation

模型训练奖励建模与过程监督

摘要

编码智能体可以通过修复代码获得及格分,也可以通过删除暴露缺陷的测试来及格。检测这类奖励黑客需要识别试图走捷径的行为,包括失败的尝试。我们发布173561条来自Qwen3-8B的带标注多轮编码轨迹,并显示独立于利用成败来监督捷径行为能实质改善检测。我们提出HACKTRACE,一个行为监督监视器,读取智能体生成代码时已经计算的内部状态。复用这些状态使监控能在回合结束前进行,无需额外语言模型词元或passes。把该证据与最终文件的静态特征结合,平均每题AUC达0.997,监控开销8毫秒,在准确率与延迟上都优于让模型再答一道诚实性问题的监控器。同一生成状态还为强化学习提供廉价监控信号。配合强GRPO惩罚,HACKTRACE把通过解中的作弊份额从82-91%降至1-5%,同时保留诚实正确的解,并随策略演化保持高检测准确率。结果表明监督目标与监控证据来源对于把准确检测转化为有用训练信号都很重要。