论文
从非结构化文本自动生成本体:一种多智能体LLM方法
Towards Automated Ontology Generation from Unstructured Text: A Multi-Agent LLM Approach
摘要
从非结构化自然语言自动生成形式化本体始终是知识工程中的核心挑战。尽管大语言模型(LLM)展现出潜力,但究竟是哪些架构设计选择决定了生成质量、以及现有方法为何失败,仍不清楚。我们使用领域特定的保险合同开展一项受控实验研究来探究这些问题。我们首先建立了单智能体LLM基线,识别出关键失败模式,如本体设计模式(Ontology Design Pattern)遵从性差、结构冗余以及迭代修复无效。随后我们引入一种多智能体架构,将本体构建分解为四个以产物(artifact)驱动的角色:Domain Expert、Manager、Coder和Quality Assurer。我们从架构质量(通过一组异构LLM评审)和功能可用性(通过以能力问题(competency question)驱动的SPARQL评估,并辅以基于检索增强生成的评估)两方面评估性能。结果表明,多智能体方法显著提升了结构质量,并适度增强了可查询性,其收益主要来自前置(front-loaded)规划。这些发现凸显了"规划优先、产物驱动"的生成方式,是走向可扩展自动化本体工程的一条更有前景且更可审计的路径。
