论文
大语言模型越狱检测多代采样实证研究
An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models
摘要
检测 大语言模型 中的越狱行为仍然具有挑战性,特别是当强对齐模型很少产生有害输出时。在这项工作中,我们使用 JailbreakBench 行为数据集和具有不同对齐强度的多个生成器模型,对现实条件下基于输出的越狱检测进行了实证研究。我们在不同的采样预算下评估了词汇 TF-IDF 检测器和基于生成不一致的检测器。我们的结果表明,单一输出评估系统地低估了越狱漏洞,因为增加采样代数会揭示额外的有害行为。当从单代采样转向适度采样时,会出现最显着的改进,而较大的采样预算会产生收益递减。交叉生成器实验表明,检测信号在模型之间部分泛化,在相关模型系列中观察到更强的转移。类别级别分析进一步表明,词汇检测器捕获行为信号和特定主题线索的混合体,而不是纯粹的有害行为。总体而言,我们的研究结果表明,适度的多样本审核为估计模型漏洞和改进 大语言模型 中的越狱检测提供了更可靠和实用的方法。代码将被发布。