论文
CQ4OE:基于能力问题评估LLM辅助本体生成的基准
CQ4OE: A benchmark for assessing LLM-assisted ontology generation from competency questions
摘要
从能力问题(CQ)生成本体是本体工程中核心却劳动密集的环节。尽管大语言模型(LLM)展现出可观的自动化潜力,当前评测仍然碎片化:任务表述各异,金标准往往缺乏细粒度的CQ溯源,指标把词汇重叠与结构和逻辑充分性混为一谈,且参考本体并不总是围绕评测CQ显式设计。本文以CQ4OE回应这些局限,这是一个用于对基于LLM的CQ本体生成进行系统、可复现评测的基准。对基准中的每个本体,我们构建由CQ驱动的金标准OWL本体,带有显式溯源,把每个CQ与回答它所需的类、属性和公理关联起来。基于该资源,我们定义两个互补的评测任务:CQ2Term在99个CQ上支持CQ特定类与属性预测的术语级评测;CQ2Onto在118个CQ上支持本体级评测,涵盖层次结构、属性建模与公理级结构。我们用九个LLM在零样本、迭代与多Agent生成策略下的实验演示CQ4OE,结果表明LLM恢复显式词汇术语比创建本体更可靠,差距尤其体现在属性建模、层次构建与公理生成上。
