论文

他们在想什么? LLM 中概念的描述、探测和跟踪

What are They Thinking? Delineation, Probing, and Tracking of Concepts in LLMs

模型评测模型行为与机制分析

摘要

随着 LLM 影响力的扩大,深入了解他们的决策势在必行。一种方法是开发探针,检测 LLM 中计算的嵌入中是否存在广泛的高级抽象概念 - 这就是我们所说的模型正在“思考”的内容。此类探针应该低成本且易于适用于任何 LLM,以便在正常操作期间监视许多概念是可能的。在本文中,我们迈出了开发创建许多此类探针的能力的第一步。通过定义和执行所需关键任务的示例来仔细描述高级抽象概念,然后,训练和测试一组线性探针以检测 LLM 的任何层上的概念,包括探索所需探针的复杂性,最后,我们证明此类探针可以在更大的上下文中跟踪概念。 LLM。当这个过程扩展到更多概念时,它将创建监控新模型的能力。