论文

AI辩论中仅凭诚实还不够

When Honesty is Not Enough in AI Debate

模型评测安全与风险评测

摘要

可扩展监督旨在验证能力超过监督者的智能体的行为。AI辩论被提出作为一种监督方案:由相互竞争的智能体帮助资源有限的验证者评估其无法独立可靠评估的声明。它的大部分前景建立在激励诚实论证以导向正确裁决之上。然而,正确裁决并不唯一确定支持它的论证。智能体可能保留呈现哪些正确声明、如何表述以及以何种顺序披露的自由。这种剩余自由可以让智能体在不妨碍裁决正确性的前提下,塑造验证者在任务相关结论之外学到的东西,从而追求潜在目标。为研究这一现象,我们提出策略性交互监督(SIO)框架,把监督同时视为验证机制和策略性通信信道。在该框架内,我们形式化了任务可容许潜在优化的概念,即在维持规定任务性能的同时追求潜在目标。作为概念验证,我们在带交叉质询的建立协议辩论中实例化SIO,并量化任务成功与关于一个隐藏变量的信息披露之间的权衡。该权衡识别出一个策略窗口:大量披露仍与任务可容许性兼容。作为缓解,我们通过扩展交叉质询者的角色来减少可容许偏见,以在有限交互视野内抑制持续性披露。我们的结果强调,评价监督不仅要看裁决的正确性,还要看其记录所传达的信息。