论文
LLM 概率算子的逻辑推理能力基准测试
Benchmarking LLM Competence on Logical Inference over Probability Operators
摘要
不确定性的表达和推论在自然语言中无处不在,对不确定性的自然语言表达进行有效的推论不仅对于日常对话是必要的,对于医学和法律等高风险领域也是必要的。虽然 大语言模型 越来越多地在逻辑推理任务上进行评估,但从巧妙的表面级模式匹配中分离出原则性的符号推理却充满了困难。我们引入了概率算子推理的基准——对具有可分级认知模态(例如,可能、可能、必须)的句子进行推理,包含跨 15 个推理模板的 14,320 个程序生成的英语提示,系统地改变问题形式、否定策略和表面内容。通过评估 29 个模型,我们发现大多数模型都表现出独立于逻辑形式的答案偏差,即对“是”或“否”的系统偏好。我们用能力底线来总结这一点:模型在“是正确”和“否正确”项目上的准确性较差。 29 个模型中只有 9 个超过了随机概率。我们还测试问题形式、动词短语/活动以及提示中使用的名称的性别和起源的变化,发现每个轴上的偏差。