论文
大语言模型有害输出概率的可靠统计界
Sound Probabilistic Safety Bounds for Large Language Models
摘要
我们提出了一种新颖的框架,用于计算 大语言模型 (LLM) 对给定提示生成有害输出的概率的严格界限。我们研究了 Clopper-Pearson 置信区间的新应用,以获得该问题的概率近似正确 (PAC) 界限。作为我们的主要技术贡献,我们提出了一种算法,该算法利用潜在空间中的特征来优先探索自回归生成树中更有可能产生有害输出的分支。我们的方法特别能够有效计算有用的下界,即使在真实危害概率极小的情况下,最重要的是,获得的下界具有可靠性保证,即,正式证明小于实际危害概率:我们的实验结果通过计算最先进的 LLM 的非平凡下界证明了我们方法的有效性。本研究新实现了LLM的评估和统计认证。