论文

超越表面形式:使用 LLM 进行符号编辑作为逻辑推理测试

Beyond Surface Forms: Symbolic Edits as a Test for Logical Reasoning with LLMs

模型评测评测方法与指标

摘要

大语言模型 (LLM) 的逻辑推理是一项关键功能,因为它反映了系统使用忠实的演绎过程从给定上下文中正确推断假设的能力。然而,LLM 推理通常被证明对问题表述中的微小表面变化敏感,从而引发了关于模型是否真正遵循底层逻辑结构的问题。研究这种行为具有挑战性,因为逻辑问题的符号组成部分(例如运算符和谓词)很难用自然语言系统地操作。我们引入了一个工具驱动的框架,用于对逻辑推理问题生成受控的、保留标签的编辑。我们的方法对一阶逻辑和约束满足问题任务的符号表示进行操作,在将逻辑运算符和其他结构组件翻译回自然语言之前能够对它们进行有针对性的修改。使用此框架,我们在累积和单独操作员编辑下评估各种 LLM,并分析他们响应这些变化的行为。我们的定量和定性分析表明,无论模型大小或系列如何,受控操作员编辑下的 LLM 推理行为都是不一致的:模型有时会正确适应结构变化,但往往无法跟踪其逻辑结果。这种自动压力测试的结果可以对不同维度的语言模型进行评估,并有助于衡量其推理的可靠性。