论文
ASCII Attack:在大语言模型中将有害请求重新包装为艺术评论
ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models
摘要
安全对齐训练大语言模型来拒绝明确提出的有害请求,但该训练主要应用于表面形式。因此,仅将相同操作内容重新上下文化、改变模型读取方式的请求仅被弱覆盖。 ASCII 攻击就是这样一种重新上下文化的方法。它是单轮黑匣子:一条消息,无法访问模型内部。它将完全清晰的有害请求嵌入到 ASCII 艺术字符中,将其呈现为艺术品,并请求反馈。与 ArtPrompt 不同,它不隐藏任何内容:请求保持可读。回复以艺术评论的形式撰写,并且可以包含普通请求会被拒绝的操作细节。每个框架提示都与直接问题控件配对,因此对比与主题、模型和解码变化无关。这一对比表明了一个捆绑的表面,而不是一个孤立的通道。在 11 个模型和 8 个危害主题中,危害感知分类器判断 62% 的框架提示对 42% 的控件有害。在最容易受影响的模型上,框架提示的成功率为 93%。根据五分之四的损害判断,单个查询匹配或超过已发布的单查询攻击。该效果更多地跟踪模型而不是主题,并且不会随着规模的扩大而减弱。至少有一名法官在近三分之二的框架行中反对专家组多数意见,这本身就是一项衡量有效性的发现。这种模式与不匹配的概括是一致的。
