论文

HarDBench:基于草稿的共同创作越狱攻击的基准,以实现安全的人类-LLM 协作写作

HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative Writing

模型评测安全与风险评测

摘要

大语言模型 (LLM) 越来越多地用作协作写作中的共同作者,用户从草稿开始,然后依靠 LLM 来完成、修改和完善其内容。然而,这种功能带来了严重的安全风险:恶意用户可能会越狱模型——用危险内容填充不完整的草稿——迫使它们生成有害的输出。在本文中,我们确定了当前 LLM 面对此类基于草稿的共同创作越狱攻击的漏洞,并介绍了 HarDBench,这是一个系统基准测试,旨在评估 LLM 针对这种新兴威胁的鲁棒性。 HarDBench 涵盖一系列高风险领域,包括爆炸物、毒品、武器和网络攻击,并具有具有现实结构和特定领域提示的提示,以评估模型对有害完成的敏感性。为了减轻这种风险,我们引入了一种基于偏好优化的安全性-实用性平衡对齐方法,训练模型拒绝有害的完成,同时对良性草稿保持帮助。实验结果表明,现有的 LLM 在共同创作环境中非常容易受到攻击,而我们的对齐方法可显着减少有害输出,而不会降低共同创作功能的性能。这提出了一种在人类-LLM 协作写作设置中评估和调整 LLM 的新范例。我们的新基准和数据集可在我们的项目页面上找到:https://github.com/untae0122/HarDBench