论文
FALSIFYBENCH:以规则发现游戏评估LLM中的归纳推理
FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games
摘要
大型语言模型 (LLM) 越来越多地被部署为科学任务中的自主代理。然而,这些系统是否能够有效地参与与科学发现相关的归纳推理形式仍然是一个悬而未决的问题。在这项工作中,我们介绍了 FALSIFYBENCH,这是一种假设驱动推理的评估框架,其灵感来自经典的 Wason 2-4-6 任务,其中代理必须通过迭代地提出示例和接收反馈来发现隐藏的语义属性。该任务捕获科学推理的关键要素:假设生成、证据收集以及根据确认和否定证据进行信念修正。我们对跨模型系列和规模的 12 个大语言模型进行的评估表明,推理模型通常比指令调整模型更强大的科学推理器,尽管没有一个模型接近最佳性能。成功的主要驱动力是负面测试的能力:积极寻求证伪假设的模型始终优于那些主要寻求确认的模型。此外,之前的工作中忽视的细粒度轮次分析揭示了失败与模型如何导航假设空间的可识别模式有关。
