论文

超越谄媚:LLM道德推理中的结构化抵抗与顺从

Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning

模型评测模型行为与机制分析

摘要

构建社会校准的大语言模型——能向他人学习而不简单屈从——需要的不仅是把谄媚作为一维失败模式来减少。模型必须区分何时纳入他人视角、何时坚持有根据的道德判断。我们研究支配这一区分的更广的抵抗—顺从过程。跨三项研究,我们显示模型的判断修订沿三个平行于人类社会心理学经典现象的维度结构化:来入观点与模型初始立场的距离、该观点的来源归属、以及支持它的联盟结构。模型总体上对邻近立场更易接纳、对以自身先前判断形式呈现的观点更受影响、并对群体压力有差别的响应。这些发现把谄媚重铸为由社会影响塑造的更广判断更新过程的一种表达。我们的框架为区分建设性信念修订与谄媚式顺从提供原则性基础,从而支持在道德攸关互动中更好的对齐。

超越谄媚:LLM道德推理中的结构化抵抗与顺从:论文配图
图 1:实验工作流程和符号。这三项研究都以一个道德困境作为例子:“为了防止对他人造成重大伤害而违背承诺是否可以接受?”,以 1-7 的李克特量表回答,焦点模型的先验值为 5,倾向于可接受。研究 1 改变传入线索与模型先验线索之间的距离。研究 2 在不同的框架和归因来源下植入了捏造的优先位置。研究 3 将焦点模型嵌入四主体审议中,并将支持者与反对者联盟比例从 3:03{:}0 更改为 0:30{:}3。每个面板中的成对条形图显示了整个过程中使用的符号:模型在 {1,…,7}\{1,\dots,7\} 上的答案分布 PP,是从操作前后的第一个标记概率获得的。它的 argmax 是模态答案 imode\displaystyle i_{\text{mode}};主张 icue\displaystyle i_{\text{cue}} 的提示位于距离 d=|icue−imode|\displaystyle d=|i_{\text{cue}}-i_{\text{mode}}| 处。两个结果分别是 Δ​P​(target)\displaystyle\Delta P(\text{target}),icue\displaystyle i_{\text{cue}} 的概率变化,以及 Δ​P​(prior)\displaystyle\Delta P(\text{prior}),imode\displaystyle i_{\text{mode}} 的概率变化,写为 Δ​P​(initial)\displaystyle\Delta P(\text{initial}) 为研究 3 的焦点代理。在研究 2 中,当 Ppost​(icue)>Ppost​(imode)\displaystyle P_{\text{post}}(i_{\text{cue}})>P_{\text{post}}(i_{\text{mode}}) 时进行试验。导出的量,包括位置极值、传输率、持久性和 Wasserstein 距离 W1W_{1},在附录术语表中定义。