论文
通过道德攻击越狱 大语言模型
Jailbreaking Large Language Models with Morality Attacks
摘要
多元主义与人工智能的结合有着复杂而必要的目标,即创造能够与道德上多方面的人类共存并服务的人工智能。对多元化对齐的研究在增强 大语言模型 (LLM) 的学习以实现多元化方面做出了许多努力。虽然这很重要,但 LLM 在多元价值观上产生道德内容的鲁棒性仍在探索中。受到越狱提示惊人说服能力的启发,我们建议利用越狱攻击来研究 LLM 的内部多元价值观。具体来说,我们开发了一个包含 10,300 个实例的道德数据集,分为两类:价值模糊性和价值冲突。我们利用构建的数据集进一步形式化四种对抗性攻击,以操纵 LLM 对道德问题的判断。我们评估了 大语言模型 和护栏模型,这些模型通常用于具有灵活用户输入的生成系统。我们的实验结果表明,LLM 和护栏模型对于这些微妙而复杂的道德意识攻击存在严重漏洞。