论文
Best-of-N采样下大语言模型对抗风险的统计估计
Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling
摘要
大语言模型(LLM)的安全评估通常在单次或低预算对抗提示下进行,这低估了真实风险。实践中,攻击者可利用大规模并行采样反复探测模型,直到产生有害响应。虽然近期工作表明攻击成功率随重复采样增长,但预测大规模对抗风险的有原则方法仍然有限。我们提出SABER,一种缩放感知的Best-of-N风险估计方法,用于建模Best-of-N采样下的越狱脆弱性。我们用Beta分布(伯努利分布的共轭先验)建模样本级成功概率,并推导出一个解析缩放律,能够从小预算测量可靠外推大N下的攻击成功率。仅用n=100样本,我们的锚定估计器预测ASR@1000的平均绝对误差为1.66,而基线为12.04,估计误差降低86.2%。我们的结果揭示异质的风险缩放画像,并表明在标准评估下显得鲁棒的模型在并行对抗压力下可能经历快速非线性风险放大。这项工作为现实的LLM安全评估提供低成本、可扩展的方法论。我们将在发表后向后续研究发布代码与评估脚本。