对齐缩放律的框架与首个预注册测量
Toward Alignment Scaling Laws: A Framework and First Preregistered Measurements
摘要
随着模型的增长,对齐变得更容易还是更困难,这通常是根据孤立的发现来争论的,就好像对齐是一种属性一样。我们将其视为一系列可测量的缩放关系:对于每个风险类别 r,保持固定安全目标所需的对齐负担被建模为 B_r(N)=a_rN^alpha_r,其中 N 是能力代理;相对于与 N 成比例的预算,如果 alpha_r<1,则扩展有帮助;如果 alpha_r~1,则保持同步;如果 alpha_r>1,则累积对齐债务。我们给出了负担的三种操作,并区分观察到的、审计的和真实的一致性。在玩具模型中,修正会消耗能力空间,从而使后果变得明确。我们证明,决定长期机制的是修正风险中最大的指数,而不是平均值;高于 1 的任何策略地板上方的净空必须超指数增长;对于幂律正混合的负担,适合小模型会低估大规模指数;并且,在没有误报的情况下发现隐藏故障的审计永远不会低估真正的一致性。我们提出了一个可预注册的协议,并应用了它的简化版本两次。对 Pythia 分类器的公共对抗性训练数据进行预先注册的重新分析发现,将攻击成功率降低到 10% 以下所需的计算量增长为 N^0.60。在 Qwen2.5 0.5B-72B 上预先注册的试点发现,真实性的指数为 -0.05,所述 行为倾向 的指数为 0.48(这两种缩放比例在其简化规则下都有帮助,尽管局部斜率在顶部接近 1;在 Qwen3 0.6B-14B 上复制),而阿谀奉承(0.89,或 0.83,在 72B 添加了两个种子)和植入的后门尚未确定:当已知其触发器时,后门会被快速移除,但在五种尺寸中的四种尺寸的盲安全训练中仍然存在。我们发布了四款遵守这些法律的浏览器游戏(www.aisafety.fun)。我们没有声明哪种制度适用于当前的前沿模型。
