论文

通过强化学习训练对齐审计员

Training Alignment Auditors via Reinforcement Learning

模型训练强化学习

摘要

前沿模型的对齐审计日益依赖大语言模型审计员来大规模发现不良行为,但当前的自动化审计员在连贯调查与审计真实性上可能表现不佳。在这项工作中,我们用强化学习改进大语言模型审计员。在我们最佳的训练环境中,策略模型调查那些可能通过系统提示植入了隐藏行为的目标模型。一个知晓目标是否藏有隐藏行为的大语言模型裁判,整体性地将策略模型的调查与参考调查进行比较以确定奖励。通过系统性消融,我们发现成对奖励比逐点奖励带来更稳健的训练,且加入未植入行为的目标有助于维持低误报率。训练提升了对植入行为目标的调查质量、在未修改的生产模型中发现可疑行为的比率以及审计真实性,同时误报率保持在1%以下。此外,审计能力可跨脚手架泛化:在AuditBench的对抗性微调目标上的表现大幅提升[Sheshadri et al., 2026]。

通过强化学习训练对齐审计员:论文配图
图1:在我们最佳训练环境中随训练轮次变化的审计表现。在该环境中,被审计的目标模型有一半的时间在系统提示中植入了隐藏行为,另一半时间则没有任何特殊系统提示。综合评估得分随训练上升,追平 Opus 4.6。审计质量超越 Opus 4.6,同时误报校准保持在 99% 以上。真实性虽未被单独优化但仍持续改善,超过 Opus 4.6。误差条为跨随机种子的 95% 置信区间,每个种子平均 n=3n{=}3 次 rollout。