论文
BioGraphletQA:复杂 QA 数据集的知识锚定生成
BioGraphletQA: Knowledge-Anchored Generation of Complex QA Datasets
摘要
本文提出了一个原则性的、可扩展的框架,用于系统地生成复杂的问答(QA)数据。该框架的核心是图基元锚定生成过程,其中知识图谱(KG)中的小子图用于结构化提示中,以控制复杂性并确保 大语言模型 生成的问题的事实依据。该框架的第一个实例是 BioGraphletQA,这是一个包含 119,856 个 QA 对的新生物医学 KGQA 数据集。每个条目都基于来自 OREGANO KG 的最多五个节点的图,其中大多数对都通过 PubMed 的相关文档片段进行了丰富。我们首先通过领域专家对 106 个 QA 对的评估来展示框架的价值和数据集的质量,确认所生成数据的高度科学有效性和复杂性。其次,我们通过证明用我们的数据增强下游基准来确定其实用性,在资源不足的情况下,PubMedQA 的准确性从 49.2% 提高到 68.5%,在资源充足的情况下,MedQA 的准确性从 41.4% 基线提高到 44.8%。我们的框架提供了一个强大且通用的解决方案,用于创建关键资源来推进复杂的 QA 任务,包括 MCQA 和 KGQA。支持这项工作的所有资源,包括数据集 (https://zenodo.org/records/17381119) 和框架代码 (https://github.com/ieeta-pt/BioGraphletQA),都是公开可用的,以促进使用、再现性和扩展。