论文
方言越狱消融:策略库而非方言表面形式驱动主要效果
What Drives Dialectal Jailbreaks? An Ablation of Surface Form, Cultural Framing, and Strategy Banks
摘要
近期研究认为,晦涩语言语体可能削弱大语言模型的拒绝行为,尤其与黑盒提示优化结合时。但失败究竟源于非标准表面形式、文化框架,还是具有丰富表达能力的提示策略空间优化,仍不明确。我们研究中文语体,将文言文红队框架扩展到上海话与粤语,在表面形式、策略库变体和两个目标模型之间开展36单元消融。主要发现具有纠偏意义:方言表面形式既不是高攻击成功率的必要条件,也不是充分条件。未经优化的英语、普通话和朴素方言翻译的攻击成功率均低于8%,而所有保留优化器控制策略库的条件达到98%至100%。文化中立的通用策略库以近乎单查询成本达到同样上限,进一步说明主要效果来自策略库表达能力,而非方言或文化内容。方言选择仍影响查询效率和响应严重程度,定性编码识别出语义释义与程序化脚手架等重复出现的高层机制。我们也限定这些接近上限的绝对成功率:它们对评审校准敏感,实验设计尚未完全分离一次性策略构造与迭代搜索。