对齐反噬:LLM多Agent系统中跨16种语言的安全干预语言依赖性反转
Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems
摘要
在罪犯治疗领域,一个反复出现的观察是洞察与行动之间的分离:违规者口头表达悔意,但行为改变并不随之而来。我们报告了四项预注册研究(跨16种语言、三个模型家族的1,584个多Agent仿真),证明大语言模型中的对齐干预会产生结构上类似的现象:表面安全掩盖或生成集体病态与内部分离。研究1(N=150)显示,增加接受对齐指令的Agent在英语中降低了集体病态(g=-1.844, p<.0001),但在日语中放大了它(g=+0.771, p=.038)——这种方向性反转被称为"对齐反噬"。研究2(N=1,174)扩展到16种语言:对齐诱发的分离几乎普遍存在(15/16种语言;beta=0.0667, p<.0001),而集体病态则沿文化-语言界线分叉(交互beta=0.0684, p=.0003),与权力距离指数相关(r=0.474, p=.064)。研究3(N=180)测试个体化作为对策;被个体化的Agent反而成为病态和分离的主要来源(DI=+1.120),从众率超过84%——证明了医源性伤害。研究4(N=80)在Llama 3.3 70B、GPT-4o-mini和Qwen3-Next-80B-A3B上验证了这些模式,确认英语中的安全性具有模型普遍性,而日语中的反噬是模型特异性的。这些发现将对齐重新框定为一种受风险稳态和医源性影响的行为干预。语言空间——从训练数据继承的语言、语用和文化属性——结构性地决定对齐结果。在英语中验证的安全性不会迁移到其他语言,提示层面的干预也无法覆盖语言空间层面的约束。
