论文

规则还是品格?AI安全设计的缩放定律

Rules or Character? Scaling Laws for AI Safety Design

模型评测评测方法与指标

摘要

人工智能(AI)安全系统将品格塑造(如基于人类反馈的强化学习[RLHF]、Constitutional AI,在训练时修改行为分布)与规则执行(如输出过滤器、安全分类器,在推理时阻断有害输出)相结合,但对于二者之间的最优平衡应如何随部署规模增长而变化,鲜有形式化分析。我们引入一个风格化的比较静态模型,将安全设计参数化为这两种方法之间 [0,1] 区间上的资源分配alpha,纳入随规模变化的过滤器退化、共模失效以及品格脆弱性——即被塑造行为在新条件下退化或崩溃的风险。在乘性Pareto损害模型下,我们推导出闭式期望损害,并通过蒙特卡洛模拟补充尾部风险(CVaR)分析。在三种情景(乐观、中性、悲观)下,最优alpha*位于内部或纯规则边界,并随部署规模T增长而轻微偏向品格塑造,依情景不同从可忽略(Δalpha* = +0.01)到显著(Δalpha* = +0.21)不等。主导参数是基线品格脆弱率 p^(0)_frag,它在整个取值范围内使alpha*移动0.50——远超尾部严重度、过滤器质量或共模失效概率的影响。在大T下,CVaR与期望损害的最优解趋于一致。这些结果表明,安全架构决策与其说取决于部署规模本身,不如说取决于分布漂移下品格塑造的可靠性。

规则还是品格?AI安全设计的缩放定律:论文配图
图2:相图:在 Δ​μ×pfrag(0)\Delta\mu\times p_{\mathrm{frag}}^{(0)} 参数空间上规模诱导的最优设计偏移。每个单元格显示 Δ​α∗=α∗​(108)−α∗​(102)\Delta\alpha^{*}=\alpha^{*}(10^{8})-\alpha^{*}(10^{2})。红色表示更大规模偏好更依赖字符的设计;蓝色则表示相反。在全部 400 个单元格中,Δ​α∗≥0\Delta\alpha^{*}\geq 0。彩色圆圈标示三个场景。这种单调性是模型的结构性质(见讨论部分)。