论文
LogicSkills:面向大语言模型形式推理的结构化基准
LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models
摘要
大语言模型在各种逻辑推理基准测试中都表现出了显着的性能。然而,目前尚不清楚他们真正掌握了哪些核心逻辑技能。为了解决这个问题,我们引入了 LogicSkills,一个统一的基准测试,旨在隔离形式推理中的三种基本技能:(i) $\textit{形式化符号化}\unicode{x2014}$将前提转换为一阶逻辑; (ii) $\textit{countermodel Construction}\unicode{x2014}$制定一个有限结构,其中所有前提都为真,而结论为假; (iii) $\textit{有效性评估}\unicode{x2014}$决定结论是否来自一组给定的前提。项目取自一阶逻辑的双变量片段(无同一性),并以自然英语和带有随机数词的卡罗尔风格语言呈现。使用 SMT 求解器 Z3 验证所有示例的正确性和非平凡性。在领先的模型中,有效性方面的表现很高,但符号化和反模型构建方面的表现却明显较低,这表明依赖于表面模式,而不是真正的符号或基于规则的推理。