论文

QMFOL:经可量化一元一阶逻辑测试用例生成的LLM推理基准

QMFOL: Benchmarking Large Language Model Reasoning via Quantifiable Monadic First-Order Logic Test Case Generation

模型评测基准与评测资源

摘要

大语言模型(LLM)在推理上取得显著进展——尤其是对高风险决策至关重要的演绎推理。随模型改进——评估基准应演化以跟上。但既有基准缺乏对逻辑复杂度的细粒度控制——且难以平衡语义多样性与逻辑一致性。为解决这些问题——我们提出QMFOL——生成带可量化、可控复杂度的一元一阶逻辑推理任务的自动化框架。它以合取与析取模式构建形式逻辑结构——实现对推理深度、宽度、标签类型与干扰项的精确控制。这些结构随后经LLM翻译为自然语言——逻辑一致性经外部证明器的往返验证确保。基于我们的框架——我们构建QMFOLBench——含2,880实例、横跨多样逻辑与语义维度的960配置的基准。对六个大型推理模型(LRM)与两个LLM的评估表明:性能随逻辑复杂度上升而退化、计算开销增加。模型在True标签任务上好于False或Unknown——并对语义变化敏感。总体而言——QMFOL为构建复杂度可控的演绎推理基准提供可扩展可靠方法——实现现代语言模型推理能力的更精确评估。

QMFOL:经可量化一元一阶逻辑测试用例生成的LLM推理基准:论文配图
图 2.QMFOL 概述。蓝色框代表输入,粉色框代表输出。 NiN_{i} 是谓词节点,可以是原子谓词 PiP_{i} 或其否定 ØPi\neg P_{i}。为简单起见,所示任务实例中的 Ni=PiN_{i}=P_{i}。