论文

作为常识推理的合理性:人类成功,大语言模型 没有

Plausibility as Commonsense Reasoning: Humans Succeed, Large Language Models Do not

模型评测模型能力评测

摘要

大语言模型 在许多语言任务上取得了出色的表现,但仍不清楚它们在歧义解决过程中是否以类人的、结构敏感的方式将世界知识与句法结构整合起来。我们用土耳其语前置关系从句依恋歧义测试这个问题,其中相同的表面字符串允许高依恋(HA)或低依恋(LA)。我们构造模糊的项目,保持句法配置固定,并确保两种解析在实用上都是可能的,而分级事件合理性选择性地偏向高依恋与低依恋。这些对比通过独立的规范评级进行验证。在快速强制选择理解实验中,人类表现出巨大的、正确定向的合理性效应。然后,我们在基于偏好的并行设置中评估土耳其语和多语言 LLM,该设置通过平均每个标记对数概率来比较匹配的 HA/LA 延续。在各个模型中,合理性驱动的转变是微弱的、不稳定的或相反的。结果表明,在测试模型中,合理性信息并不像人类判断那样可靠地指导依恋偏好,并且它们强调土耳其语 RC 依恋是超越广泛基准的有用的跨语言诊断。