论文

关于人类极性错觉背后的机制,LLM 能告诉我们什么?跨模型规模和训练步骤的实验

What can LLMs tell us about the mechanisms behind polarity illusions in humans? Experiments across model scales and training steps

模型评测模型行为与机制分析

摘要

我使用 Pythia 缩放套件(Biderman 等人,2023)来研究 LLM 中是否以及如何出现两种众所周知的极性错觉(NPI 错觉和深电荷错觉)。随着模型尺寸的增加,NPI 错觉变得更弱并最终消失,而深度电荷错觉在较大的模型中变得更强。结果对人类句子处理有影响:考虑到 LLM 无法合理地参与这种推理,尤其是在下一个标记预测的隐式层面上,可能没有必要假设将格式错误的句子转换为格式良好的句子的“理性推理”机制来解释极性错觉。另一方面,浅层的、“足够好”的处理和/或规定性不合语法结构的部分语法化都可能发生在 LLM 中。我提出了一种植根于构式语法基本原则的不同理论解释的综合。