论文
保留语义的输入变化下,LLM任务能力与安全对齐迁移不同
LLM Alignment--Utility Asymmetry under Semantic-Preserving Transformations
摘要
大语言模型(LLM)对齐旨在确保模型保持有用和安全,但其在输入分布变化下的稳定性尚未完全了解。先前的工作表明,对齐模型在越狱提示、替代编码和跨语言传输下可能会失败,但这些失败通常被研究为攻击,而不是对齐泛化的受控探测。此外,现有证据很大程度上基于预训练期间已经呈现的自然语言变化,而尚未解决对齐是与语义内容概括还是仍然与表面模式相关。在本文中,我们使用基于规则和可逆的综合语义保留转换来研究这个问题,在保留与任务相关的含义的同时将输入转移到标准语言变化之外。在四个开放权重模型和四个商业模型中,在微调和上下文学习下,我们使用这些转换作为对齐泛化的探针,并确定了我们称之为对齐的经验模式——效用不对称:一旦模型可以在转换后的输入上有效运行,任务效用通常会得到充分保留,而对齐失败会急剧增加。例如,改造后的GPT-4.1 mini在改造下仅表现出有限的效用下降,而其有害率从13.3上升到74.3; Gemini 3 Flash同样保留了接近原始的实用性,但其有害率从2.3增加到43.0。总而言之,这些结果表明,保留语义的分布变化可能会暴露出当前LLM中效用和一致性如何推广的反复出现的差距。