论文
符号查询还是语义检索?面向半结构化问答的数据集与方法
Query Symbolically or Retrieve Semantically? A Dataset and Method for Semi-Structured Question Answering
摘要
用于问答的检索增强生成(RAG)系统通常依据查询与文档块之间的语义相似度来检索证据。这种方法对非结构化文本有效,但在半结构化语料上可靠性较低,因为作答可能需要对跨多个文档的结构化属性进行精确过滤、聚合或穷尽式检索。符号化方法支持此类操作,但在含噪的自然语言语料上往往脆弱。我们用DualGraph来弥合这一缺口,这是一个通过两种互补视图表示文档的RAG框架:用于语义检索的文本知识图谱(Textual Knowledge Graph),以及用于在带类型的主语-谓语-宾语三元组上进行符号查询的符号知识图谱(Symbolic Knowledge Graph)。基于这两个组件,我们提供了选择或组合语义证据与符号证据的多种策略。我们还提出SpecsQA,一个源自商业购物网站的基准,包含半结构化产品文档与人工整理的问题,涵盖开放式与规格导向的检索。实验表明,DualGraph在各类问题上持续优于最先进的稠密检索、GraphRAG、符号化与面向表格的基线。代码与数据可在https://github.com/corneliocristina/DualGraphRAG获取。
