论文
超越行为权衡:LLM中苦乐决策的机制追踪
Beyond Behavioural Trade-Offs: Mechanistic Tracing of Pain-Pleasure Decisions in an LLM
摘要
先前行为研究提示,当选项被表述为引发痛苦或快乐时,某些LLM会改变选择,且此类偏差可随所述强度扩大。为把行为证据(模型做什么)与机制可解释性(什么计算支撑它)衔接起来,我们考察效价相关信息在transformer内如何表示、在何处被因果使用。我们使用Gemma-2-9B-it与仿照既往工作的极简决策任务:(一)用跨数据流的分层线性探测绘制表示可用性图谱;(二)以激活干预(转向;修补/消融)检验因果贡献;(三)在epsilon网格上量化剂量—反应效应,同时读取2-3 logit差值与按数字对归一化的选择概率。我们发现:(a)效价符号(痛苦对快乐)从极早层(L0-L1)起在各数据流族中完全线性可分,而词汇基线保留大量信号;(b)分级强度可被强解码,峰值见于中晚层、尤其注意力/MLP输出,且决策对齐在末词元稍前处最高;(c)沿数据导出的效价方向做加性转向,可在晚位因果调制2-3差值,最大效应见于晚层注意力输出(attn_out L14);(d)头级修补/消融提示这些效应分布于多个注意力头而非集中于单一单元。这些结果共同把行为敏感性联系到可识别的内部表示与干预敏感位点,为更严格的反事实检验与更大范围复现提供了具体的机制靶点。本工作支持更有证据依据的(一)AI感知与福祉讨论,以及(二)制定政策、审计标准与安全保障时的治理。