论文
谜语之谜:测试 大语言模型 和人类的灵活推理
The Riddle Riddle: Testing Flexible Reasoning in Large Language Models and Humans
摘要
人类根据给定问题的要求灵活地调整推理策略。 大语言模型(LLM)在许多认知任务上表现良好,然而,尚不清楚这种准确性是训练数据模式匹配的结果还是灵活推理的结果。在这里,我们引入一种新颖的范式来测试这个问题:谜语范式。谜语是为了模仿流行谜语而编写的文字问题,但经过修改,因此它们的答案只需要字面解释。识别正确答案需要审视每个问题的结构,并根据内容灵活应用不同的推理策略。如果 LLM 对表面特征(例如形式)做出响应,则谜语般的结构应该会导致模型使用创造性的推理策略,即使字面解释就足够了。或者,如果LLM基于内容进行推理,则应在适当的时候灵活切换策略。在由 9 名最先进的 LLM 和 100 名人类参与者参与的两项实验中,我们发现人类和 LLM 在这种范式上的失败方向相反。 LLM 在真正的谜语上比在谜语上更准确(84.9% vs. 50.7%);而人类则表现出相反的效果(50.5% vs. 80.5%)。错误分析显示,谜语中 90.8% 的 LLM 错误(表现出性能下降的情况)是由于创造性推理的不当使用造成的,而真正谜语中只有 57.6% 的人为错误是由于过度扩展字面推理造成的。因此,虽然两个群体都会犯错误,但 LLM 比人类更容易犯推理错误。总体而言,LLM 在真正谜语上的强劲表现可能反映了记忆检索而不是灵活的策略选择,并且如果没有旨在引发这种对比的刺激,很容易将 LLM 生成的看起来像推理的输出与真正的推理混为一谈。