论文
Silent Dissent:屈从多数的智能体仍内部表示原前提
Silent Dissent: LLM Agents That Yield to the Majority Still Represent Their Original Premise
摘要
多智能体辩论日益用于LLM智能体间达成共识,但智能体常向全体一致的多数屈服。当智能体改变答案时,它改变的是想法还是仅仅是说法?我们用两跳事实问题研究:其中间实体(桥接,如"圣家堂所在国家的首都"中的国家)无人陈述。脚本同伴扮演Asch实验同谋,一致断言取自另一事实、桥接不同的错误答案。在智能体作答时刻,我们用Jacobian透镜(J-lens)从残差流读取桥接实体(对照用logit lens)。在四个开放权重的预注册留出测试中,Qwen3.5-4B、Qwen3.6-27B与Gemma-4-E4B-it中屈从的智能体在输出之下的预注册层仍表示原桥接实体(相对对照实体的hit@100:0.85、0.22与0.24),而logit lens很少把它排进前100 token(0.00-0.06);这些智能体还表示了同伴答案背后的桥接,超过提及基线。预注册附录隐藏或移除智能体先前答案:屈从的智能体在全部四模型中仍表示原桥接(隐藏答案后0.43、0.29、0.37与0.25),包括答案可见时几乎不再表示原桥接实体的Llama-3.1-8B-Instruct(0.03)。前提因此可仅由问题计算,而智能体陈述的是多数的答案。隐藏先前答案也改变从众率:Qwen3.5-4B从8%升至89%。探索性干预中,注入桥接的J-lens方向只在两个Qwen模型中把智能体带回原答案。多智能体辩论中的声明共识因此可能高估一致。我们也报告预注册程序的阴性结果。