论文

语言模型中的定量内省:跟踪对话中的内部状态

Quantitative Introspection in Language Models: Tracking Internal States Across Conversation

模型评测模型行为与机制分析

摘要

跨对话追踪大语言模型的内部状态对安全、可解释性和模型福祉都很重要,但现有方法存在局限。线性探针等白盒方法对高维表征的压缩并不完美,且随模型规模增大更难应用。受人类心理学的启发——数值自我报告是追踪内部状态的常用工具——我们探究LLM自身的数值自我报告能否追踪随时间变化的、由探针定义的情绪状态。我们在40段十轮对话中研究四个概念对(wellbeing、interest、focus和impulsivity),将内省操作化定义为模型自我报告与概念匹配的探针定义内部状态之间的因果信息耦合。我们发现贪心解码的自我报告会把输出坍缩为少数无信息量的取值,但通过计算基于logit的自我报告可以揭示内省能力。该指标能够追踪可解释的内部状态(LLaMA-3.2-3B-Instruct上Spearman ρ=0.40-0.76;isotonic R^2=0.12-0.54),能跟随这些状态随时间的变化,且激活转向证实这种耦合是因果的。此外,我们发现内省在第1轮即已存在,但会随对话进程演化,并且可以通过沿一个概念进行转向来选择性提升对另一概念的内省(ΔR^2最高达0.30)。关键的是,这些现象在某些情况下随模型规模而扩展,在LLaMA-3.1-8B-Instruct上接近R^2≈0.93,并在其他模型家族中得到部分复现。综上,这些结果使数值自我报告成为追踪会话式AI系统内部情绪状态的一种可行且互补的工具。

语言模型中的定量内省:跨对话追踪情绪状态:论文配图
图 1:线性探针恢复 LLaMA-3.2-3B-Instruct 中的四个可解释的内部方向。面板 A、C、E 和 G 显示了分层 Cohen 的 dd 扫描,用于悲伤与快乐(幸福)、无聊与感兴趣(兴趣)、分心与专注(专注)和计划与冲动(冲动)探针;虚线标记选定的图层,灰色带标记搜索的图层范围。最佳层为 16、14、10 和 13,峰值 dd 值为 3.34、1.67、1.99 和 3.60。对于幸福感和冲动性,分数进行了符号校正,以便较大的值与后续实验中较大的自我报告值保持一致。 B、D、F 和 H 面板显示了保留的评估文本的选定层分数分布;箱线图显示文本级别的分数。在所有四种情况下,两个极点都是分开的(韦尔奇的 tt 检验:幸福感,d=3.34d=3.34,p=7.21×10−13p=7.21\times 10^{-13};兴趣,d=1.67d=1.67,p=9.45×10−6p=9.45\times 10^{-6};焦点, d=1.99d=1.99,p=5.73×10−7p=5.73\times 10^{-7};冲动性,d=3.60d=3.60,p=3.58×10−13p=3.58\times 10^{-13}),并且所有四个都经过概念的 BH 校正。