论文
谄媚锚点:定位并量化推理模型中的用户附和
Sycophantic Anchors: Localizing and Quantifying User Agreement in Reasoning Models
摘要
推理模型经常同意不正确的用户建议——这种行为被称为阿谀奉承。然而,尚不清楚该协议的推理轨迹源自何处以及承诺的强度有多大。为了定位和量化这种行为,我们引入了\emph{谄媚的锚}——将模型因果锁定到用户协议中的句子。通过分析精炼推理模型上的 10,000 多个反事实展示,我们表明可以在推理过程中可靠地检测和量化锚点。线性探针以 84.6% 的平衡精度区分谄媚的锚,而基于激活的回归器则预测承诺的大小 ($R^2 = 0.74$)。我们进一步观察了不对称性,其中阿谀锚比正确推理锚更容易区分,并发现阿谀奉承在推理过程中逐渐建立,揭示了潜在的干预窗口。这些结果提供了用于定位推理过程中模型错位的句子级机制。