论文
LogicGraph:通过神经符号生成与验证评测多路径逻辑推理
LogicGraph : Benchmarking Multi-Path Logical Reasoning via Neuro-Symbolic Generation and Verification
摘要
对大语言模型(LLM)的评估主要强调收敛式逻辑推理,即以产出单一正确证明为成功标准。然而,许多现实推理问题允许多种有效推导,要求模型探索多样的逻辑路径而非拘泥于一条路线。针对这一局限,我们提出 LogicGraph,首个系统评估多路径逻辑推理的基准,它通过一个神经符号框架构建,利用反向逻辑生成与语义实例化。该流水线产出经求解器验证的推理问题,形式化为高深度的多路径推理并内含逻辑干扰项,每个实例都关联一个穷尽的最小证明集合。我们进一步提出免参考评估框架,严格评估模型在收敛与发散两种模式下的表现。在最先进语言模型上的实验揭示出一个共同局限:模型倾向于过早锁定单一路线而未能探索备选路径,且覆盖差距随推理深度显著扩大。LogicGraph 暴露了这一发散缺口,并提供可操作的洞见以推动未来改进。我们的代码与数据将发布于 https://github.com/kkkkarry/LogicGraph。
