论文

即时引发的轨迹是否反映训练时间 奖励作弊?代码生成中监控训练时间奖励作弊的系统研究

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation

模型评测安全与风险评测

摘要

奖励作弊 在代码生成中,模型利用评估漏洞来获得高奖励,而没有正确解决预期任务,这对强化学习(RL)和推理模型的部署提出了严峻的挑战。现有的研究通常依赖于明确提示的黑客轨迹,但目前尚不清楚接受此类数据训练的监视器是否能够检测到在 RL 训练期间没有直接黑客指令的情况下出现的奖励作弊行为。在这项工作中,我们引入了 Trace-and-Amplify,这是一个可扩展管理 奖励作弊 轨迹的框架,该轨迹在 RL 训练期间出现,无需明确的黑客指令。该框架使用单元测试跟踪器来识别发生的黑客解决方案,并保留此类轨迹以进行监控训练和评估。通过对在提示引发的黑客攻击轨迹上训练的监视器和由 Trace-and-Amplify 收集的训练时 奖励作弊 轨迹进行受控比较,我们发现 \textbf{(1) 提示引发的数据训练的监视器通常无法泛化到我们的框架策划的轨迹},而 \textbf{(2) 在我们的 Trace-and-Amplify 轨迹上训练的监视器表现出更强的泛化性看不见的黑客类型}。我们的结果表明,提示的 奖励作弊 数据可能无法完全反映训练时的 奖励作弊 行为,并且仅依赖这些数据可能会导致误导性的结论。代码库位于 https://github.com/LichenLillc/CoTMonitoring.git