论文
大语言模型 中的类人照应分辨率
Human-Like Anaphor Resolution in Large Language Models
摘要
照应词是引用其他表达方式的表达方式,称为先行词。连接两者的过程称为解析。认知科学已经确定了影响照应消解速度和成功的多种因素,包括语篇结构、情境模型属性和语义因素。在这里,我们研究这些因素是否也影响开放权重的五个 大语言模型 (LLM) 中的照应解析:GPT-2-XL、Llama-3.1-8B、Pythia-12B、Mistral-7B 和 Mistral-24B。为了模拟处理难度,我们采用标准链接假设,将人类阅读时间与照应词的惊讶模型联系起来。作为第二个行为测量,我们将模型的准确性与人类在探究照应词先行词的理解问题上的准确性进行比较。结果显示选择性认知对齐:一些 LLM 对话语突出性和照应解析中基于距离的因素表现出类似人类的敏感性,同时对语义干扰效应表现出较弱或不敏感。这些发现界定了 LLM 近似人类照应分辨率的条件。