论文

你在跟我讲逻辑吗?评估语言模型三段论推理能力

Are you Talking Logic to Me? Assessing Language Models Syllogistic Reasoning Capabilities

模型评测模型能力评测

摘要

语言模型 (LM) 很难处理逻辑任务,例如三段论推理。事实证明,知识表示(KR)在表达输入信息以帮助模型解决任务方面发挥着至关重要的作用。这一观察结果促使我们通过扩展 FOLIO 和 P-FOLIO 数据集来研究不同形式 KR 符号对三段论推理的影响。我们在有监督的 微调 (SFT) 和零射击 (ZS) 设置中对小语言模型 (SLM) 进行的实验表明,输入符号的选择可以产生与自然语言竞争的性能,同时实现更快的推理。我们还提出了一种三段论分类方法(SEF),并用它来用逻辑定义丰富 ZS 提示,从而促进小模型中的推理。我们开源了我们的框架 Common Logic Grammar Construction (CLGC),作为第一个用于自动生成 KR 符号中的三段论并定义其 SEF 类别的 Python 库。