论文

FALSIFYBENCH:以规则发现游戏评估LLM中的归纳推理

FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games

智能体系统Agent任务评测

摘要

大型语言模型 (LLM) 越来越多地被部署为科学任务中的自主代理。然而,这些系统是否能够有效地参与与科学发现相关的归纳推理形式仍然是一个悬而未决的问题。在这项工作中,我们介绍了 FALSIFYBENCH,这是一种假设驱动推理的评估框架,其灵感来自经典的 Wason 2-4-6 任务,其中代理必须通过迭代地提出示例和接收反馈来发现隐藏的语义属性。该任务捕获科学推理的关键要素:假设生成、证据收集以及根据确认和否定证据进行信念修正。我们对跨模型系列和规模的 12 个大语言模型进行的评估表明,推理模型通常比指令调整模型更强大的科学推理器,尽管没有一个模型接近最佳性能。成功的主要驱动力是负面测试的能力:积极寻求证伪假设的模型始终优于那些主要寻求​​确认的模型。此外,之前的工作中忽视的细粒度轮次分析揭示了失败与模型如何导航假设空间的可识别模式有关。

FALSIFYBENCH:以规则发现游戏评估LLM中的归纳推理:论文配图
图 1:FalsifyBench 游戏结构。玩家会获得三个项目(例如,口袋蝙蝠、撇渣器和跗节),并且必须通过提出额外的测试三元组并接收来自预言机的反馈(“符合”与“不符合”)来识别他们共享的隐藏目标规则(例如“它们是动物”)。在提出测试三元组之前,玩家明确提出有关正在测试的隐藏规则的假设。在正面测试中,所提出的三元组预计会满足该假设,而在负面测试中,预计会证伪该假设。这个过程一直持续到玩家有足够的信心他们已经识别出隐藏的规则并将其表达为猜测。如果所述假设正确,则游戏结束;否则,玩家将继续进行新的测试三元组。