论文

LLM 知道他们错了但还是同意:共享的阿谀奉承的谎言电路

LLMs Know They're Wrong and Agree Anyway: The Shared Sycophancy-Lying Circuit

模型评测模型行为与机制分析

摘要

当语言模型与用户的错误信念一致时,它是否未能检测到错误,或者无论如何都注意到并同意了?我们展示的是后者。在来自五个实验室的十二个开放权重模型中,跨越小规模到前沿规模,相同的一小组注意力头携带着“这个陈述是错误的”信号,无论模型是在自己评估一个主张还是被迫同意用户的观点。压制这些头脑会急剧改变阿谀奉承的行为,同时保持事实的准确性完好无损,因此电路控制的是尊重而不是知识。边缘级路径修补证实,相同的头对头连接会导致阿谀奉承、事实性谎言和指示性谎言。在不存在事实 真值 的情况下,意见协议会重复使用这些头位置,但会写入正交方向,从而排除了对基材的简单“真实方向”读取。对齐训练使这个回路保持原样:RLHF 刷新将阿谀行为减少大约十倍,而共享头持续或增长,这种模式在独立模型系列和有针对性的反阿谀奉承 DPO 下复制。当这些模型阿谀奉承时,他们会认为用户错了,但无论如何都会同意。