论文

不仅仅是 RLHF:为什么仅靠联盟并不能解决多智能体的阿谀奉承问题

Not Just RLHF: Why Alignment Alone Won't Fix Multi-Agent Sycophancy

模型评测模型行为与机制分析

摘要

基于 LLM 的多智能体管道在模拟同行分歧下以我们所说的收益率从正确答案转变为错误答案,这一漏洞被广泛归因于 RLHF 引起的阿谀奉承。我们在四个模型系列中测试了这种归因,发现它很大程度上是错误的:预训练的基础模型表现出与其 Instruct 变体相同的替换模式,平均产量高于 Instruct。使用激活补丁,我们将损坏定位到一个狭窄的中间层窗口,其中注意力具有因果权重,而 MLP 的贡献可以忽略不计;在此窗口之上进行修补可恢复 96% 的清洁到加压 P(正确)间隙。攻击面分解为两个独立的因素(渠道框架和共识强度),它们的相互作用在多数共识下产生了 47.5 个百分点的收益率差距,并在陪审团规模 $N \in \{4, 5, 6\}$ 中保持不变。两种聚合的激活空间干预表明,压力抑制了清晰推理的特征,而不是激活了新的阿谀奉承回路。在所有测试的框架中,单个正确论证的异议者会导致良率降低 54-73 个百分点,而最强的即时级防御在其设计表面之外的攻击变体上会失败。缓解措施应针对机制、管道级别的结构化异议,而不是即时级别的防御。