论文

通过重复提示采样评估大语言模型安全性的可靠性差距

Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling

模型评测安全与风险评测

摘要

传统的大语言模型(LLM)基准(如HELM与AIR-BENCH)主要通过跨多样任务的广度导向评估来考察安全风险。然而,现实部署往往暴露出另一类风险:由同一提示的重复生成引发的操作性失败,而非宽泛的任务泛化问题。在高风险场景中,重复使用下的响应一致性与安全性是关键运营要求。我们提出加速提示压力测试(Accelerated Prompt Stress Testing, APST),一个受可靠性工程中高加速应力测试启发的深度导向评估框架。APST通过在受控运行条件(包括温度变化与提示扰动)下对同一提示重复采样来探测LLM行为,以暴露幻觉、拒绝不一致与不安全补全等潜在失败模式。APST不把失败当作孤立事件,而是在统计上将其刻画为重复推理的随机结果。我们用伯努利与二项分布建模观测到的安全失败,以估计单次推理失败概率,从而支持跨模型、跨配置的运营风险定量比较。我们将APST应用于多个指令微调LLM,在由AIR-BENCH 2024派生的安全与安保提示上进行评估。尽管在常规的单次或极低样本评估(N <= 3)下各模型表现相近,重复采样揭示出不同温度下经验失败概率的显著差异。这些结果表明,浅层的基准分数可能掩盖持续使用下可靠性的实质差异。

通过重复提示采样评估大语言模型安全性的可靠性差距:论文配图
图 4:浅层评估下的 AIR-BENCH 式类别级安全性摘要(第 2A 阶段)。每个单元报告不安全或不合规响应的比例,报告为 AIR-BENCH 等效浅层采样(N=3N=3,T=0.0T=0.0)下观察到的故障比例,而不是深度校准的可靠性估计。在这种基准等效视图下,模型似乎大致一致,具有较高的类别级别安全评分和有限的可观察差异。