论文

Lingtai:关于LLM推理,几何揭示了什么概念,以及没有揭示什么

Lingtai: What Concept Geometry Reveals--and Does Not Reveal--About LLM Inference

模型评测模型行为与机制分析

摘要

在自回归推理期间观察大语言模型的计算结果(在线且无需训练探针)仍然很困难。我们引入了 Lingtai,一个免训练的概念遥测层:在每个生成步骤,残差状态被投影到特定领域的命名概念锚点库上,这些锚点在没有标记概念示例、结果标签、梯度拟合或激活空间优化的情况下构建,产生结构化的每步概念坐标信号。在代码生成和小学数学推理中,该信号表现出与预测不确定性的稳健关联:该关联在问题身份和词元位置控制中仍然存在,并且不能归因于单个词元类型,不能通过 GSM8K 上的简单正确/不正确混合来解释,也不能通过匹配的随机锚点来再现;它在 K 均值和 PCA 投影中明显较弱或方向不一致。出现了两种结构:一个重复出现的不确定性相关活动信号,其功能几何是任务条件的(HumanEval、MBPP 和 GSM8K 上的不同活动熵形状),以及具有强局部惯性但弱重新实例化不变性的执行特定轨迹标识——在仅完成弹性对齐下,匹配的重新执行子集上 k=32(大约完成的中值四分之一)处的损坏仍然检索存档的情节62.0%,而新执行的检索率仅为 11.7-16.0%。最后,匹配审计没有发现任何证据表明此处使用的标量概念活动信号在测试协议下提供了稳定的正确性坐标;因此,我们将正确性视为外部提供的。遥测为 161 锚点代码实现增加了 0.7-1.6% 的每个词元解码开销,且生成的词元保持不变。