论文
AI控制中的重试与重采样对比
Retrying vs Resampling in AI Control
摘要
Claude Code和Codex等AI编码脚手架使用重试(retrying):阻止被标记为有风险的动作并继续轨迹。我们从AI控制(AI control)的视角研究重试,该视角将模型视为潜在对抗性的。我们发现,虽然重试降低了诚实的怀疑分数,但不可信模型可以利用监控器的判断理由构造更隐蔽的攻击,从而抵消安全收益。我们还研究了重采样(resampling):从同一上下文抽取多个样本,这不会泄露可被利用的信息。我们拆解了以往重采样研究中捆绑在一起的设计选择。在BashArena中,以Claude Opus 4.6作为不可信模型、MiMo-V2-Flash作为可信监控器,每步抽取五个样本并按最大怀疑分数进行审计,在0.3%的审计预算下将安全性从61%提升至71%,且不损失有用性。只对首次抽样中看似可疑的步骤进行选择性重采样,能以仅10%的额外抽样量挽回6.2个百分点的收益。我们在此设定中的两项发现与以往重采样研究相矛盾。其一是基于重采样怀疑分数最大值的审计优于使用最小值,这与Ctrl-Z的发现相反。其二是执行最不可疑样本——以往defer-to-resample协议的核心机制——在我们的设定中只带来很小的实证安全收益(+3.9个百分点,置信区间与零重叠)。
