论文

HOLMES:评估LLM中的高阶逻辑推理

HOLMES: Evaluating Higher-Order Logical Reasoning in LLMs

模型评测基准与评测资源

摘要

逻辑推理对可靠AI至关重要——但既有基准大多以一阶逻辑为中心——聚焦固定谓词上的对象级演绎。这错过许多现实场景——模型必须对规则、谓词、函数、约束与决策过程本身推理。我们介绍HOLMES(高阶逻辑遇见真实世界可解释符号推理)——首个面向LLM高阶符号推理的真实世界基准——含1,379实例。HOLMES建立在高阶逻辑上——把自然语言问题与HOL形式化、真值答案、可验证推理踪迹及跨法律与金融的细粒度可控推理因素配对。实验表明当前LLM在HOLMES上仍然吃力——平均准确率仅50.64%、最佳模型达59.54%。我们的分析进一步揭示:高最终答案准确率可能掩盖冲突消解设定中的捷径推理——而性能在范围条件化与组合推理下急剧下降。这些发现把高阶符号推理识别为构建可靠可验证LLM的关键瓶颈。项目代码与数据集公开于 https://github.com/wuyucheng2002/HOLMES。

HOLMES:评估LLM中的高阶逻辑推理:论文配图
图 1:一阶推理和高阶推理之间差异的图示。 FOL 推理通常评估固定谓词下对象的演绎,而 HOL 推理可以将谓词、函数和规则本身视为推理对象。