论文

语言模型是否编码违反语言约束的知识?

Do Language Models Encode Knowledge of Linguistic Constraint Violations?

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 实现了强大的语言性能,但其产生这些预测的内部机制仍不清楚。我们研究了这样的假设:LLM 在其参数内编码语言约束违规的表示,这些参数在处理不语法的句子时有选择地激活。为了测试这一点,我们使用稀疏自动编码器将多语义激活分解为稀疏的单语义特征,并恢复与违规相关的候选特征。我们引入了敏感度评分,用于识别在违反约束的输入和格式良好的输入上优先激活的特征,从而能够对潜在的违反特定特征进行无监督检测。我们进一步提出了一个联合证伪框架,其中三个标准共同评估。总体而言,结果在两个方面都是负面的:(1) 不同语言现象并没有共同满足证伪标准,(2) 所有类别之间没有一致共享的特征。虽然某些现象显示出选择性因果结构的部分证据,但总体模式为当前 LM 中的一组统一的语法违规检测器提供了有限的支持。