论文
通过共同训练的监督员改善可扩展的监督
Improving scalable oversight with co-trained monitors
摘要
工人-监视器设置是一种很有前景的人工智能监督方法,但针对固定监视器对工人进行训练可能会刺激监视器逃避。我们研究是否可以通过对监视器与工人进行共同训练来避免这种故障模式,并探索监督和自我监督的方法。在监督设置中,我们证明了一个特征:当可能的监控函数类别具有有限的 Littlestone 维数时,监控是可能的,并且误差和查询率会消失。这将工人监控与对抗性在线学习的现有文献联系起来。对于自我监督,我们提出了一种基于测试时间蒸馏的协同训练程序:监视器使用额外的测试时间计算来生成训练标签,然后在这些标签上训练其标准计算策略。对于多数票标签,我们在具有动作覆盖的自适应工作人员分布下给出有限样本锐化保证,这表明监视器的判决收敛于其初始模态判决。我们在代码安全设置中对前者进行压力测试,其中工作人员接受对抗性训练以欺骗监视器。我们的结果表明,自适应监视器能够更好地跟上不断变化的工作人员策略,而固定监视器更容易逃避。