论文

情绪很重要:句法敏感性如何破坏安全对齐

Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

模型评测模型行为与机制分析

摘要

大语言模型 通常会经历 后训练 以使它们与安全策略保持一致,但存在许多复杂的越狱,可以绕过既定的安全措施。例如,Andriushchenko 等人之前的工作。 (2025)发现,将语法时态从现在时改为过去时足以引起有害的反应。在这项工作中,我们发现了非命令句法形式的更普遍的失败。我们使用行为评估证明了这种句法漏洞存在于 16 个模型中,多达 70B 个参数。为了调查根本原因,我们应用因果中介分析,发现拒绝部分取决于上游句法特征。通过控制这些纯粹的句法特征,我们能够触发和抑制拒绝。最后,我们将这种病态追溯到开源模型的语言偏见 后训练 数据,并表明增加句法多样性可以缓解该问题。我们的研究结果表明,当前的对齐方法引入了混杂因素,阻碍了拒绝决策的纯粹语义基础。