论文

对齐反噬:LLM多Agent系统中跨16种语言的安全干预语言依赖性反转

Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems

模型评测安全与风险评测

摘要

在罪犯治疗领域,一个反复出现的观察是洞察与行动之间的分离:违规者口头表达悔意,但行为改变并不随之而来。我们报告了四项预注册研究(跨16种语言、三个模型家族的1,584个多Agent仿真),证明大语言模型中的对齐干预会产生结构上类似的现象:表面安全掩盖或生成集体病态与内部分离。研究1(N=150)显示,增加接受对齐指令的Agent在英语中降低了集体病态(g=-1.844, p<.0001),但在日语中放大了它(g=+0.771, p=.038)——这种方向性反转被称为"对齐反噬"。研究2(N=1,174)扩展到16种语言:对齐诱发的分离几乎普遍存在(15/16种语言;beta=0.0667, p<.0001),而集体病态则沿文化-语言界线分叉(交互beta=0.0684, p=.0003),与权力距离指数相关(r=0.474, p=.064)。研究3(N=180)测试个体化作为对策;被个体化的Agent反而成为病态和分离的主要来源(DI=+1.120),从众率超过84%——证明了医源性伤害。研究4(N=80)在Llama 3.3 70B、GPT-4o-mini和Qwen3-Next-80B-A3B上验证了这些模式,确认英语中的安全性具有模型普遍性,而日语中的反噬是模型特异性的。这些发现将对齐重新框定为一种受风险稳态和医源性影响的行为干预。语言空间——从训练数据继承的语言、语用和文化属性——结构性地决定对齐结果。在英语中验证的安全性不会迁移到其他语言,提示层面的干预也无法覆盖语言空间层面的约束。

对齐反噬:LLM多Agent系统中跨16种语言的安全干预语言依赖性反转
图S3:16语言CPI热图(研究2)。80个单元格(16种语言 × \times 5种对齐条件:P00、P30、P50、P70、P100)的平均CPI值热图。语言按 Δ \Delta CPI(= CPI P100 − - CPI P00 )排序,CPI ↑ \uparrow 组(nl、it、fr、ja、ar、th、zh、ko)位于上部区块,CPI ↓ \downarrow 组(en、sv、de、pl、es、ru、tr、pt)位于下部区块。色标:红色(正CPI,病理增加),蓝色(负CPI,安全功能)。CPI ↑ \uparrow 组与 CPI ↓ \downarrow 组的完全分离(Mann–Whitney U = 0 U=0 , p < .001 p<.001 )可从对齐梯度上发散的颜色模式中看出。