编码器就足够了吗? LLM对抗性评估的编码器和解码器安全判断器的系统比较
Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation
摘要
随着 大语言模型 (LLM) 在聊天机器人和日常应用中的广泛采用,公司越来越需要有效的护栏,同时保持低成本和低延迟。 LLM 输出的安全评估通常依赖于基于 LLM 的判断器,这种判断器可能有效,但大规模部署通常缓慢且昂贵。在本文中,我们评估了 ModernBERT 系列(包括 ModernBERT 和 Ettin)中经过微调的现代编码器分类器是否能够可靠地识别用户模型对话中有害的 LLM 输出,而相对于基于 LLM 的判断器,是否会造成显着的性能损失。我们使用跨开源对抗数据集的一系列判断提示策略,针对基于规则的前缀匹配、微调的 LLM 分类器和 LLM 判断器对这些编码器分类器进行基准测试。 LLM 评委包括来自 StrongReject、ShieldGemma、JailbreakBench、AILuminate、SorryBench 和 Claude 作为评委设置的评估方法,以及经过微调的安全分类器,例如 LlamaGuard 3 和 LlamaGuard 4。编码器分类器使用多数投票标签策略对评委标记的数据进行微调,然后根据黄金标准进行评估保留数据集来评估他们相对于 LLM 评委的表现。我们使用 F1 分数、假阴性率和精确召回率指标来报告绝对性能。我们还通过攻击技术来分解结果,包括单轮提示、分解、升级和上下文操作,以确定编码器分类器与基于 LLM 的判断器一致或分歧的地方。我们的研究结果为编码器分类器何时可以作为基于 LLM 的安全评估的成本效益和延迟效率的替代方案提供了指导。