论文
大语言模型的有效性感知越狱评估
Validity-Aware Jailbreak Evaluation for Large Language Models
摘要
越狱鲁棒性已成为大语言模型 (LLM) 安全评估的核心,但流行的方法主要依赖于拒绝行为、语义相似性和意图匹配启发法,这些方法强调语言的合理性而不是正确性。我们发现现有评估中的一个关键限制:许多越狱意图取决于教学有效性而不是认知事实性,允许看似现实的反应被标记为成功,尽管事实上或程序上不正确。为了解决这一差距,我们提出了顺序认知和操作级验证(SEAV),这是一种以验证为中心的越狱评估框架,它将响应分解为有序步骤并评估有效性和正确性。 SEAV 将 LLM 作为语义解释的法官机制与使用外部知识源的基于检索的验证相结合,评估生成的内容是否事实上正确、结构一致以及在操作上是否能够推进有害目标。根据经验,SEAV 与最强基线相比,将 SD-A(一种策划的战略不诚实诊断)的假阳性率降低了 14.9%,并在四个公共基准中的三个中将 22.1%--51.0% 的先前标记成功样本重新分类为无效。总之,这些结果表明,强制执行正确性极大地重塑了测量的稳健性:许多先前标记的越狱成功被重新分类为无效,并且结果在测试的搜索后端和评估器模型中保持稳定。代码和数据可在 https://github.com/Ardor-Wu/SEAV 获取。
