论文

CATCH:RL 编码中奖励作弊的可控分析测试平台

CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL

模型评测基准与评测资源

摘要

在具有可验证奖励的强化学习(RLVR)过程中,大语言模型(LLM)可以利用其环境中的漏洞来获得高额奖励,而无需提高预期能力,即奖励作弊。尽管对训练效率和安全性存在风险,但在训练期间监控和减轻奖励作弊仍然具有挑战性,这受到缺乏重现黑客攻击并可靠识别黑客攻击的测试平台的限制。我们引入了 CATCH,这是一个用于研究 RL 编码中的奖励作弊行为的可控测试平台。 CATCH 通过将易受攻击的评估者的成功与独立审计下的任务正确性进行比较,故意暴露环境漏洞并提供基于执行的金标签。它还可以通过有监督的微调数据混合物来控制模型的初始黑客倾向,并通过奖励设计来控制获得奖励的难度,从而能够系统地比较黑客动态和干预措施。实验表明,CATCH 可以产生具有明显奖励作弊行为的多样化 RL 训练轨迹,分析表明初始模型和奖励难度都影响了奖励作弊行为的出现。我们进一步评估不同奖励作弊检测和缓解方法的有效性。一个重要的发现是,思维链监控器最初会抑制黑客攻击,但随着策略模型学会用代码注释误导监控器,这种保护就会减弱。这凸显了在整个训练过程中使用 CATCH 评估黑客攻击缓解措施的必要性。源代码和资源公开发布于https://github.com/THUAIS-Lab/CATCH.