论文

无利害关系AI预测器中源自诚实的安全性

Safety from Honesty in a Disinterested AI Predictor

模型训练预训练

摘要

随着AI系统变得更有能力,优化下游结果的训练流程可能引入隐式智能体——设计者从未指定的目标导向行为。我们为Scientist AI(SAI)预测器提出形式安全论证:预测器经训练近似以“认识情境化”自然语言语句数据集为条件的贝叶斯后验。我们论证该预测器可以诚实地预测智能体、行动及其后果——而其自身不是选择输出以达成目标的智能体。这取决于数据表示与训练流程:文本的认识情境化区分潜在事实声明与通信行为——目标表达被当作待解释的证据而非模型采纳的驱动。以后验寻求的训练目标,驱动预测器走向校准的谨慎预测。训练使部署预测的下游效应永不作为奖励信号;系统所需的任何智能体由受护栏约束的显式脚手架提供。我们证明在训练动力学与危险预测器的稀疏性假设下:训练产出守卫部署中残余伤害超过指定阈值的预测器的概率很小——危险预测器必须在多个查询中以协调方式低估伤害,而此类协调模式在初始化分布下罕见且不接收直接训练信号。