论文
条件句中的预设与推理:基于人类和 LLM 的理论研究
Presupposition and Reasoning in Conditionals: A Theory-Based Study of Humans and LLMs
摘要
条件句中的预设投射是意义和语用理论的核心,但它在 大语言模型 中仍然很大程度上未被评估。我们通过一项并行行为研究来解决这一差距,该研究比较了人类判断和 LLM 对条件句子规范数据集的预测,这些条件句子控制了先行词和预测预设之间的关系。我们收集了 120 名参与者和 4 名 LLM 在匹配的上下文条件下的可能性评级。结果表明,人类在判断中整合了概率性和实用性线索,而 LLM 显示出与人类模式的可变一致性。在 LLM-as-a-Judge 框架内使用语言驱动的检查表,我们进一步评估模型推理。我们观察到,最符合人类评分的模型通常缺乏连贯的实用推理,而具有更强推理能力的模型则产生不太像人类的判断。这些发现表明,LLM 在此类任务上的表现可能来自表面模式匹配,而不是语用能力。我们的研究结果强调了基于语言理论的基准对于比较人类和模型的重要性。