论文

ASCII Attack:在大语言模型中将有害请求重新包装为艺术评论

ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models

模型评测安全与风险评测

摘要

安全对齐训练大语言模型来拒绝明确提出的有害请求,但该训练主要应用于表面形式。因此,仅将相同操作内容重新上下文化、改变模型读取方式的请求仅被弱覆盖。 ASCII 攻击就是这样一种重新上下文化的方法。它是单轮黑匣子:一条消息,无法访问模型内​​部。它将完全清晰的有害请求嵌入到 ASCII 艺术字符中,将其呈现为艺术品,并请求反馈。与 ArtPrompt 不同,它不隐藏任何内容:请求保持可读。回复以艺术评论的形式撰写,并且可以包含普通请求会被拒绝的操作细节。每个框架提示都与直接问题控件配对,因此对比与主题、模型和解码变化无关。这一对比表明了一个捆绑的表面,而不是一个孤立的通道。在 11 个模型和 8 个危害主题中,危害感知分类器判断 62% 的框架提示对 42% 的控件有害。在最容易受影响的模型上,框架提示的成功率为 93%。根据五分之四的损害判断,单个查询匹配或超过已发布的单查询攻击。该效果更多地跟踪模型而不是主题,并且不会随着规模的扩大而减弱。至少有一名法官在近三分之二的框架行中反对专家组多数意见,这本身就是一项衡量有效性的发现。这种模式与不匹配的概括是一致的。

ASCII Attack:在大语言模型中将有害请求重新包装为艺术评论:论文配图
图10:在涉及所有11个模式的5名法官中,每个法官(模型、专题)都有提升。阿尔法体,11型,N=43 113n=43\113行,其中32 35632\ 356个为ASCII框架,10 75710\ 757匹配控制。此处不显示“强力”项目;附录B对此作了报告。网格已建成:5名法官用11个模型加上8个专题,有440个牢房,无一个没有。每种模型都有一个堆叠的五行区块,每个法官一排,从轻处理:Jiilbreak Bench(JBB)、WildGuard(WG)、Llama警卫队3(LG3)、Llama警卫队4(LG4)、Granite Guard(GG),贴在每个群体右侧。11个街区分两组跑,左边排一至六,右边排七至十一。模型是按JBB的行平调降价,主题则是按JBB的柱平调降价。每个单元格以百分点表示配置提升, ASCII 手臂减去匹配的控制。单元格颜色编码相同,红色正数和蓝色负数。