论文
Build2SPARQL:用于楼宇知识图谱查询的大规模文本到 SPARQL 基准数据集
Build2SPARQL: A Large-Scale Text-to-SPARQL Benchmark Dataset for Building Knowledge Graph Querying
摘要
楼宇自动化系统越来越多地表示为使用 Brick 和 ASHRAE 223P 等本体的语义知识图 (KG),为人工智能应用创建机器可读的基础。一种有前途的应用是将自然语言问题转换为 SPARQL(文本到 SPARQL),这将允许楼宇运维人员通过语言Agent查询这些图,但由于大型自然语言/SPARQL 基准的稀缺,进展受到限制。本文介绍了 Build2SPARQL,这是一个由知识图谱驱动流程生成、用于楼宇知识图谱的大规模基准:SPARQL 查询完全由图遍历代码生成和验证,而大语言模型仅生成自然语言问题,从而保持查询正确性独立于模型行为。该管道挖掘六个查询模式系列——线性链、分支、UNION、聚合、可选和属性过滤——以及以五种词汇语域表述每条查询。应用于 201 个建筑 KG(180 个 Brick、21 个 ASHRAE 223P)时,它生成 6,136 个可执行 SPARQL 查询和 30,680 个问题。对 300 个问题进行的两位评估者人工验证发现,语义保真度为 98.8%,自然度为 98.8%,操作可信度为 84.0%。对三种开放权重语言模型的检索增强评估将精确匹配准确率从 0.2-20%(零样本)提高到 56-65%(三样本检索)。