论文

隐喻并不是所有需要注意的地方

Metaphor Is Not All Attention Needs

模型评测模型行为与机制分析

摘要

大语言模型 越来越多地部署在安全关键型应用中,在这些应用中,其抵抗有害指令的能力至关重要。尽管 后训练 的目标是使模型对许多越狱策略具有鲁棒性,但最近的证据表明,风格的重新表述(例如诗意转换)仍然可以以惊人的有效性绕过安全机制。这就提出了一个核心问题:文学越狱为何能成功?在这项工作中,我们研究了它们的有效性是否取决于特定的诗意手段、无法识别文学格式,或者模型处理风格不规则提示的更深层次的变化。我们通过注意力模式的可解释性分析来解决这个问题。我们进行输入级消融研究,以评估个体和诗意手段组合的贡献;构建注意力图的可解释向量表示;对这些表示进行聚类并训练线性探针来预测安全结果和文学格式。我们的结果表明,模型可以高精度区分诗歌和散文格式,但很难预测每种格式的越狱成功。聚类进一步揭示了按文学格式而非安全标签进行的明显区分。这些发现表明,越狱的成功并不是由于无法识别诗歌格式造成的;而是由于无法识别诗歌格式造成的。相反,诗意的提示会引发独特的处理模式,这些模式在很大程度上独立于有害内容的检测。总体而言,文学越狱似乎不是通过任何单一的诗意手段来错位 大语言模型,而是通过积累的文体不规则性来改变提示处理并避免在 后训练 期间考虑词汇触发因素。这表明鲁棒性需要安全机制来解释风格引起的模型行为变化。我们使用 Qwen3-14B 作为代表性的开放重量案例研究。