论文
从文本到分数:追踪 大语言模型 中论文质量表征的出现
From Texts to Scores: Tracing the Emergence of Essay Quality Representations in Large Language Models
摘要
大语言模型 (LLM) 的最新进展极大地改变了自动作文评分 (AES),但基于 LLM 的评分背后的内部机制仍然知之甚少。在这项工作中,我们系统地分析了两个英语论文数据集(ASAP++、CSEE)和一个葡萄牙语数据集(ENEM)中的 8 个 LLM 的隐藏表示。使用线性探测、交叉提示泛化、降维和神经元级分析,我们找到了一致的证据,表明论文质量信息在 LLM 表示中以可线性访问的形式编码。这些表征在各层中逐步出现,在提示策略中保持稳健,并且尽管评分标准存在差异,但在论文提示中部分转移。此外,与线性探针相比,非线性探针仅提供边际且不一致的改进,这表明大多数论文质量信息已经是线性可解码的。我们进一步确定了个体“论文评分神经元”,其激活与论文分数密切相关,并且其行为对有针对性的干预敏感。此外,这些神经元的分层分布随着论文长度而系统地变化,较长的论文更依赖于更深的层。总的来说,我们的研究结果提供了 LLM 编码与论文质量相关的结构化表示的证据,并为基于 LLM 的 AES 系统的可解释性提供了新的见解。