论文

用于评估科学 AI 中 LLM 推理的基于本体论、经过推理机验证的基准

Ontology-Grounded, Reasoner-Verified Benchmarks for Evaluating LLM Reasoning in Scientific AI

模型评测上下文与知识本体基准与评测资源

摘要

大语言模型 (LLM) 越来越多地支持科学人工智能应用,这些应用对结构化知识进行推理,从生物医学问答到材料信息学。然而,他们的逻辑推理常常不足,导致在这些情况下产生不可接受的事实错误。可靠的评估仍然具有挑战性:手动数据集构建的扩展性很差,基于 LLM 的生成风险会嵌入其旨在衡量的缺陷。高质量的基准必须将正确和不正确的标记示例建立在明确的背景知识中,并可由标准推理器进行正式验证。我们提出了一个管道,可以从任何充分公理化的 OWL 2 本体中自动生成基于本体的多项选择问题 (MCQ) 基准,并通过设计以本体为基础的正确答案。干扰子是通过扰动类定义公理的右侧类表达式来生成的,并且它们的不正确性由 OWL 推理器通过蕴涵检查进行正式验证。我们评估了三个本体的管道:Pizza(小型,学术)、PMDco(复杂,材料科学)和 DOID(大型,生物医学),分别生成 112、2,491 和 15,216 个 MCQ。干扰因素涵盖从类不可满足性到弱包含的四个语义类别,从而能够对特定推理失败进行诊断评估。项目符合自然语言质量标准:大语言模型平均评判分数为 4.02、4.36 和 3.36(满分 5 分)确认流畅性,正确答案与干扰项相似度高于 0.8 表明不能仅从表面形式上排除错误选项。六位大语言模型评估了零样本的准确率达到 41.1-76.8%,远高于 25% 的随机猜测基线,表明基准具有挑战性和歧视性。这项工作是朝着评估科学人工智能逻辑推理的更可靠基准迈出的一步。