论文
受限 Best-of-$N$ 推理时间缩放中的安全黑客
Safety Hacking in Constrained Best-of-$N$ Inference-time Scaling
摘要
推理时间管道通常会对多个输出进行采样,使用学习的安全模型对其进行过滤,并返回具有最高学习奖励的代理可行输出。我们证明这种组合会造成两阶段的失败:不完美的安全代理首先用不安全的输出污染可行集,然后奖励最大化可以放大这种残留污染。我们将 \emph{安全黑客} 定义为选择通过学习约束但违反真实安全标准的输出。对于受约束的 Best-of-N$ 采样,我们得出由代理可行集内安全和不安全输出的联合上奖励尾部控制的有限 $N$ 边界。如果不安全但可行的输出具有较重的尾部,那么随着 $N$ 的增长,安全黑客攻击将变得渐近确定,即使误报质量以及平均安全和奖励代理错误任意小。我们还表明,与代理可行参考分布的有限 $χ^2$ 差异内的政策承认 $N$ 独立的安全黑客界限,并用约束悲观抽样实例化了这种一般覆盖控制原则。覆盖控制限制了放大,但无法修复受污染的可行集:承认不安全的输出可能仍然受到青睐,并且对于每个奖励代理来说,正则化选择不一定比受约束的 Best-of-$N$ 更安全。玩具和语言模型实验表征了污染及其奖励尾放大,这暴露了使用学习的安全模型进行推理时间缩放的固有困难。