论文

如何避免辩论:经双高效交互证明的可扩展AI安全

How to Avoid Debate: Scalable AI Safety via Doubly-Efficient Interactive Proofs

模型推理推理验证与自校正

摘要

随着AI模型持续发展强大能力——能够验证其输出与我们意图对齐变得至关重要。近期一条工作线聚焦经辩论的验证——一种交互证明模型:两个竞争的强大证明者(或AI模型)相互辩论——以使弱验证者(或人类)相信其声明的正确性。但辩论假设两个AI模型能力相当且其中之一诚实——这可能不现实。本工作中——我们展示如何避免辩论:开创面向AI安全的单证明者交互证明研究。单证明者交互证明的既有结果不能直接照搬到AI安全设定:例如——当计算可访问神谕(如人类判断或网页等外部数据库)时它们不适用。我们为神谕辅助计算(亦称相对化证明)提出双高效单证明者交互证明与论证——在以下设定中:(1) 计算是稳健的——即至多少量神谕查询答案错误时输出不变;或(2) 神谕是低次多项式。这些结果表明即使没有辩论——在结构化或噪声容忍的神谕访问下——交互验证也是可能的。