论文
无控制的表征:在语言模型中检验实现效应
Representation Without Control: Testing the Realization Effect in Language Models
摘要
大语言模型(LLM)越来越多地被用作行为模拟器,但它们的输出何时反映类人认知机制、而非对提示敏感的表面模式,仍不清楚。我们通过实现效应(realization effect)来研究这一问题——实现效应是行为经济学中一个已被充分刻画的现象:在账面(未实现)盈亏与已实现盈亏之后,风险承担行为存在系统性差异。我们在三个层面评估LLM行为:仅基于提示的行为敏感性、内部表征的线性读取(linear readout),以及通过激活引导(activation steering)进行的因果控制。仅基于提示的结果显示出系统性的条件敏感性,但其方向性模式并不能复现人类实现效应的预测。Gemma 的残差流在第18层包含一个可线性解码的实现状态信号,且该信号可泛化到保留(held-out)提示上。然而,沿该方向进行引导并不能可靠地改变下游风险选择,这一零结果在正向尺度以及负向符号对称运行中均成立。行为敏感性、潜变量读取与因果控制是三种彼此独立的属性,并不必然同时出现;成功的潜变量读取不足以证明模型在下游决策中行为上依赖某一表征。