论文

大语言模型 的红队框架:忠实性 评估案例研究

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

模型评测安全与风险评测

摘要

大语言模型 (LLM) 在自然语言处理任务中表现出了卓越的性能,但它们在高风险应用程序中的部署引起了对可靠性、安全性和可信度的严重担忧。在本文中,我们提出了一个红队框架,可以系统地发现 LLM 输出中的漏洞。我们的方法采用了一种新颖的多角色架构,包括目标、攻击者和陪审团模型。攻击者产生越来越有效的对抗性提示,而陪审团则严格评估任务之间的响应准确性和一致性。在案例研究中,事实证明,我们的策略在揭露 LLM 回复中的不忠行为方面特别有效。在问答任务中,利用对抗性提示将攻击成功率提高了 7.9%,暴露了可靠性方面的弱点。该方法确定了摘要中的结构约束如何塑造漏洞模式,格式限制在 忠实性 中产生可测量的收益,并表明在确定模型安全性时,架构设计选择通常比参数缩放更重要。该框架的主要优势在于其跨评估任务的适应性,从英语问答到阿拉伯语摘要,从而能够对模型漏洞进行全面比较。虽然它擅长比较跨模型和跨语言的漏洞,但它在完全自动化跨语言的对抗性提示生成方面面临挑战。我们的实验还揭示了检测微妙形式的不忠行为的局限性,这些不忠行为不会表现为明确的事实矛盾,特别是在语言环境中。总体而言,该架构既提供了对当前 LLM 漏洞的可操作见解,也提供了随着模型的发展进行持续安全评估的可扩展方法。