论文

在自然文本中植入潜在变量:对 LLM 中的信念状态及其与概念几何的联系进行更现实的测试

Planting a Latent Variable in Natural-Looking Text: a More Realistic Test of Belief States in LLMs and Their Link to Concept Geometry

模型评测模型行为与机制分析

摘要

LLM 被认为可以跟踪“信念状态”,即在控制语言的潜在变量上运行概率分布(Shai 等人,2024 年;Sarfati 等人,2026 年),但到目前为止,这仅在玩具合成数据和一些孤立的案例研究中得到了全面证明。它也从未在经验上与 LLM 特征的几何结构(模型激活中可解释性的概念)联系起来。在这项工作中,我们在自然的文本中植入了一个可控的潜在变量。 LLM 老师编写普通文本,而我们“下意识地”引导它沿着每个标记处的 K = 8 个不相关的稀疏自动编码器方向之一,其中活动方向遵循环形马尔可夫链。在此语料库上训练的小型 Transformer 模型确实跟踪了关于我们植入的潜在变量的贝叶斯后验信念。此外,它还将 8 个状态本身按照马尔可夫链的精确顺序排列在一个环上,这支持了概念的几何形状可以由其背后潜在变量的统计动力学形成的证据。