论文

从 LLM 激活测量文本中的概念内容:来自概念向量和线性探针的 ESG 证据

Measuring Concept Content in Text from LLM Activations: ESG Evidence from Concept Vectors and Linear Probes

模型评测模型行为与机制分析

摘要

现有的衡量文本关于概念的程度的衡量标准是读取文本的表面:词典单词份额、主题比例、嵌入相似性。他们对文本使用的词语进行评分,而不是读者对此的判断。最近的研究表明,大语言模型 (LLM) 内部了解的内容与他们在响应中表达的内容之间存在差距。本文询问,在测量概念内容时,通过监控冻结的、开箱即用的 LLM 的激活来读取的内部知识是否可以代替特定于任务的 微调,以及哪种提取方法读取效果最好。我们通过递归特征机(RFM)算法和线性探测来提取这些度量,并将它们与嵌入基线、表面基线以及同一模型自己对问题的答案进行比较。我们使用人工注释的环境、社会和治理 (ESG) 数据集演示了金融文本的方法,该领域已被广泛研究并由已建立的注释资源提供服务。最好的线性探针在没有任何特定于任务的 微调 的情况下,与微调域分类器的准确性相差 0.6 个百分点以内,并且在 12 次比较中的 11 次中得分超过了同一模型自己对问题的回答,因此激活携带了响应未报告的概念内容。简单的探针始终胜过 RFM 概念向量,而 RFM 概念向量又提供了单独分类所无法提供的功能:连续分数旨在反映概念在文本中存在的强度,其验证等待分级标签。