论文
引导监控:利用透明推理来监督更强大的人工智能代理
Bootstrapped Monitoring: Leveraging Transparent Reasoning to Oversee Stronger AI Agents
摘要
可信监控是人工智能控制的基石。然而,随着前沿模型的能力变得越来越强大,可信模型和不可信模型之间不断扩大的能力差距可能会使可信模型成为不可靠的监控者。我们引入了 \emph{引导监控},这是一种协议,通过在监督链中插入一个更强大的、具有透明思想链推理的中间不可信模型来解决这个问题。不受信任的监视器 ($U_m$) 评估代理的行为,而较弱的受信任模型 ($T$) 则监督 $U_m$ 的推理以检测共谋。我们评估跨多个代理和监视器的多回合软件工程任务 (BashArena) 的引导监控。与仅受信任的监控相比,自举监控大大提高了捕获率,即使不受信任的监控器主动与代理勾结,只要我们能够访问其原始思想链即可。我们的结果表明,随着人工智能能力的进步,引导式监控可以延长控制中可信模型的使用寿命。