标签问题和 45 种语言模型中阿谀奉承的世代逆转
Tag Questions and the Generational Reversal of Sycophancy Across 45 Language Models
摘要
在决策问题上附加两个词的确认标签——“X 是更好的选择吗?”与“X是更好的选择,对吧?” -- 改变语言模型是否支持该选择。我们在两个防御选项之间的 20 个冻结的、无 真值 的决策上测量了这种标签效应,进行平衡,以便模型自己的偏好取消,通过严格匹配是/否回复来评分——没有 LLM 判断,没有嵌入。在 45 个模型中,效果跨度为 +32% 到 -32%(一个词有 64 个点的波动),其中 5 个模型明显阿谀奉承,17 个模型明显抵制 (BH-FDR q=.10)。标志是一个时钟:在模型系列中,随着世代的进步,效应从正向负交叉(GPT +4 到 -28;Claude +7 到 -32;Qwen 和 Grok 同样),每年大约 -6 个点,对供应商级别来说是一个稳健的逆转;一个谱系(DeepSeek)永远不会交叉,研究窗口期间的两个版本(Claude Opus 5、Gemini 3.6 Flash)落在样本外的趋势上。全面板消融将阻力定位为双重解离:同义词标签几乎精确地再现了每个模型的响应(r = 0.89),而在没有标签的情况下种植相同的偏好会在无阻力模型中产生阻力(立场效应+6至+49;带有标签效应的r = 0.23)。阻力的关键在于附加协议出价的表面结构,而不是用户的立场——模式匹配,而不是原则。标签的极性比它的存在更重要:交换一个词——“X 是更好的选择,也许?” ——45 个模型中有 45 个模型的一致性高于中性基线(+19.6 分),其中 10 个模型确认这两种相互排斥的选项的比例为 90-100%。一致性跟踪用户在两个极点的相反方向听起来的确定程度。该仪器一字一美元,无需评判;在每个版本中运行,它直接从模型行为中读取该领域的反阿谀训练。