论文
CommonWhy:用于评估 大语言模型 中基于实体的因果常识推理的数据集
CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models
摘要
为了有效地与现实世界交互,大语言模型 (LLM) 需要基于实体的常识推理,这是一项具有挑战性的任务,需要将有关特定实体的事实知识与常识推理相结合。用于评估 LLM 基于实体的常识推理的现有数据集主要集中在对/错或多项选择问题上,而对模型在因果推理和生成解释方面的能力的明确评估在很大程度上未经审查。在这项工作中,我们引入了 CommonWhy,这是一个包含 15,000 个“为什么”问题的数据集,旨在评估有关 LLM 中因果关系的基于实体的常识推理。 CommonWhy 还可以作为知识图问答 (KGQA) 基准,因为回答其查询所需的所有支持知识都可以在维基数据知识图中找到。与主要测试事实检索的现有 KGQA 数据集不同,CommonWhy 针对因果常识推理,为 KGQA 评估建立了新的范式。基于最先进的 LLM 和 LLM 的 KGQA 方法的实验揭示了它们的显着缺点,包括频繁的事实幻觉和因果推理失败。