论文
大语言模型 中的假设生成和更新
Hypothesis generation and updating in large language models
摘要
大语言模型 (LLM) 越来越多地帮助人们解决问题,从调试代码到修复机器。这个过程需要从部分描述中生成合理的假设,然后随着更多信息的到来而更新它们。然而,LLM 如何执行这种形式的推理,以及它与最优的接近程度仍不清楚。我们在数字游戏中研究这个问题,这是一种受控环境,其中学习者推断由一些正整数支持的假设,例如 $\{16, 8, 2, 64\}$:类似于 2 的幂的规则或类似于接近 20 的数字的区间。我们使用三个互补的探针来测量假设的后验:后验预测、假设评估和假设生成。然后,我们将 LLM 行为与最佳贝叶斯模型和人类行为进行比较,并测试跨探针是否表达相同的后验。 LLM 通常可以通过双参数贝叶斯拟合来很好地描述,但存在系统性偏移:默认情况下,它们显示强采样假设,该假设创建隐式奥卡姆剃刀,有利于更窄的假设,而思维模式将它们转向更大的先验依赖。我们还发现了一个稳健的评估——代沟:LLM 在假设评估期间选择更正确的假设,但生成更简单、更类似于规则的假设。最后,这种带有偏差的贝叶斯模式不会进行推断。模型的表现就好像它们对观察到的示例持有类似规则的假设,但对于这些示例未涵盖的假设域部分的泛化效果很差。我们的结果凸显了 LLM 作为一般问题解决器的局限性,特别是对于科学推理,假设必须超越数据。