论文
语言模型中的定量内省:跟踪对话中的内部状态
Quantitative Introspection in Language Models: Tracking Internal States Across Conversation
摘要
跨对话追踪大语言模型的内部状态对安全、可解释性和模型福祉都很重要,但现有方法存在局限。线性探针等白盒方法对高维表征的压缩并不完美,且随模型规模增大更难应用。受人类心理学的启发——数值自我报告是追踪内部状态的常用工具——我们探究LLM自身的数值自我报告能否追踪随时间变化的、由探针定义的情绪状态。我们在40段十轮对话中研究四个概念对(wellbeing、interest、focus和impulsivity),将内省操作化定义为模型自我报告与概念匹配的探针定义内部状态之间的因果信息耦合。我们发现贪心解码的自我报告会把输出坍缩为少数无信息量的取值,但通过计算基于logit的自我报告可以揭示内省能力。该指标能够追踪可解释的内部状态(LLaMA-3.2-3B-Instruct上Spearman ρ=0.40-0.76;isotonic R^2=0.12-0.54),能跟随这些状态随时间的变化,且激活转向证实这种耦合是因果的。此外,我们发现内省在第1轮即已存在,但会随对话进程演化,并且可以通过沿一个概念进行转向来选择性提升对另一概念的内省(ΔR^2最高达0.30)。关键的是,这些现象在某些情况下随模型规模而扩展,在LLaMA-3.1-8B-Instruct上接近R^2≈0.93,并在其他模型家族中得到部分复现。综上,这些结果使数值自我报告成为追踪会话式AI系统内部情绪状态的一种可行且互补的工具。
