论文
Metaphor Tracer:一种基于理论的隐藏状态分析
Metaphor Tracer: A Theory-Informed Analysis of Hidden States
摘要
语言模型的隐藏状态能揭示单篇文本的组织方式吗?仅凭一次前向传播、无需任何训练,我们按两个属性为每个token位置打分。*聚合器*衡量该位置是否将整篇文本整合为一个稳定构型;*区分器*衡量随着模型阅读,其他token是否被短暂携带进入其子空间——这是隐喻的本义:搬运、迁移。所有常数在一篇发现文本上冻结;其余所有结果均为验证性。聚合器在经典意义上既不是信息度量,也不是显著性度量。在三个互不相关的模型中,随着一个能指不断重复,其惊奇度与注意力逐渐耗散,而其聚合器得分保持不变:该通道标记着token在文本中的位置。这一指标之所以能追踪一种阅读过程,依据的是独立的真值:一个聚合器能跟随其跨越边界的工程化语域(6/6格),以及一位精神分析学家在临床逐字稿上的标注——该标注在此工具出现之前即已固定——命中34/36格,且相对词汇对照呈梯度增量,并展现出任何类型级度量都无法复现的分离模式。一项迁移测试给出了结果的形态:其token结构随词汇类型迁移的模型对单篇话语的阅读最差;而在一组匹配的base/instruct模型对中,微调提升了保真度,却不改变类型迁移。结构性价值是token在*这篇*文本中所处位置的属性,而非其向量本身的属性:这是对隐藏状态的一种关系论而非本质主义解读,并将先于该工具存在的理论加以操作化。