论文
语言模型的条件推断尚未稳定体现人类语用推理
Tracing the ongoing emergence of human-like reasoning in Large Language Models
摘要
人类能轻松理解字面之外的含义。例如,“如果你割草,我给你五十美元”通常暗示只有割草才会付钱;“如果你饿了,烤箱里有披萨”则意味着无论是否饥饿,披萨都在那里。大语言模型在多种任务上达到类人表现,但是否像人类一样推理仍不清楚。 研究通过群体匹配实验,比较 25 种语言模型在四种语言中的条件推断,与每种语言中等量的人类表现。人类跨语言使用语用推断丰富逻辑推理;模型行为则更多变,有些严格遵循条件句真值表,却忽视语用推断,另一些偏离真值表、对所有情况采用单一解释。总体而言,模型可以准确处理语义规则,却未能稳定捕捉人类推理中的语用补充。开放或闭源状态、训练方向与架构类型都不能预测或提升这项准确性,提示语用推理仍是人工系统正在形成的能力。