论文

AI控制中的重试与重采样对比

Retrying vs Resampling in AI Control

智能体系统Agent 动作执行与治理Agent Harness

摘要

Claude Code和Codex等AI编码脚手架使用重试(retrying):阻止被标记为有风险的动作并继续轨迹。我们从AI控制(AI control)的视角研究重试,该视角将模型视为潜在对抗性的。我们发现,虽然重试降低了诚实的怀疑分数,但不可信模型可以利用监控器的判断理由构造更隐蔽的攻击,从而抵消安全收益。我们还研究了重采样(resampling):从同一上下文抽取多个样本,这不会泄露可被利用的信息。我们拆解了以往重采样研究中捆绑在一起的设计选择。在BashArena中,以Claude Opus 4.6作为不可信模型、MiMo-V2-Flash作为可信监控器,每步抽取五个样本并按最大怀疑分数进行审计,在0.3%的审计预算下将安全性从61%提升至71%,且不损失有用性。只对首次抽样中看似可疑的步骤进行选择性重采样,能以仅10%的额外抽样量挽回6.2个百分点的收益。我们在此设定中的两项发现与以往重采样研究相矛盾。其一是基于重采样怀疑分数最大值的审计优于使用最小值,这与Ctrl-Z的发现相反。其二是执行最不可疑样本——以往defer-to-resample协议的核心机制——在我们的设定中只带来很小的实证安全收益(+3.9个百分点,置信区间与零重叠)。

AI控制中的重试与重采样对比
图 1:通过不同协议以 0.3% 的审计预算实现的安全性。标有美元符号的协议比没有标有美元符号的协议成本更高。重试协议很容易受到红队的利用,导致与可信监控相比无法获得安全保障。如果通过取最小值来聚合重新采样以进行审计决策,则重新采样会造成伤害,但如果通过最大值进行聚合,则重新采样会有所帮助。执行最不可疑的样本比仅使用重新采样获取信息稍微有帮助。