论文

审计代码强化学习环境中可被利用的奖励漏洞

Auditing Reward Hackability in Code RL Training Environments

模型评测安全与风险评测

摘要

本文测量代码强化学习环境将错误解判为正确的比例。在SWE-bench Verified的49个任务样本中,28.5%的任务测试不足以拦截经Docker验证的错误补丁;对来自6个仓库的20个R2E-Gym任务,单次生成漏洞利用补丁的同一流程得到25.0%。针对134份前沿模型SWE-bench Verified结果的随机效应元分析发现,在人工评定难度相同的层内,可被利用的任务比稳健任务的Pass@1高14.14个百分点,95%置信区间为[11.80,16.48],单侧p<10⁻⁶,I²=0%,134个模型中123个差值为正。作者随后提出加固流程:在调用LLM裁判前,先用Docker让每条新生成测试运行标准解,检查测试是否误拒正确补丁。在审计出的11个缺陷任务上,该校验发现105条有决定作用的新增测试中65条会使标准补丁失败,缺陷率61.9%,而仅用LLM裁判未识别这些问题。经偏向多样性的重试,11个任务中9个完成带校验的测试升级。