论文

Polar 探针线性解码 LLM 的语义结构

Polar probe linearly decodes semantic structures from LLMs

模型评测模型行为与机制分析

摘要

人工神经网络如何绑定概念形成复杂的语义结构?在这里,我们提出了一个简单的神经代码,实体之间关系的存在和类型分别由它们嵌入之间的距离和方向表示。我们在各种 大语言模型 (LLM) 中测试了这一假设,每个输入都带有来自五个不同领域的极简任务的自然语言描述:算术、视觉场景、家谱、地铁地图和社交互动。结果表明,可以使用针对 LLM' 层激活子空间的 Polar Probe 线性恢复真实的语义结构。其次,该代码主要出现在中间层,并随着 LLM 性能的提高而改进。第三,这些极地探针成功地推广到新的实体和关系类型,但随着语义结构的大小而退化。最后,极坐标表示的质量与 LLM 回答有关语义结构的问题的能力相关。总之,这些发现表明 LLM 学习通过将表示与简单的几何原理结合来构建复杂的语义结构。