论文

面向大语言模型异构知识上事实一致性与顺序鲁棒锚定推理的反事实基准与训练

Counterfactual Benchmarking and Training for Factuality Consistency and Order-Robust Grounded Reasoning in LLMs over Heterogeneous Knowledge

模型架构Transformer

摘要

大语言模型(LLM)日益支持以用户提供的异构结构知识为基础的回复生成。然而,现有基准对LLM能否在此类知识情境上忠实执行多跳推理链、并对输入顺序变化保持鲁棒,评估十分有限。我们提出TKFQA,一个事实一致性基准,包含10130个基于表格、文本和知识图谱(KG)的问答(QA)对。每个样例都由显式的反事实推理链构建,可联合评估答案正确性、推理链准确性以及对不同输入顺序的鲁棒性。对14个开源与闭源大语言模型的广泛评估表明,最先进模型的推理链准确性有限,且对异构知识情境输入顺序的变化仍然敏感。为解决这些局限,我们提出ORLF,一个与大语言模型无关的训练框架,通过知识特定的潜向量建模跨情境拓扑关系。ORLF整合情境级位置编码、潜桥注意力掩码和拓扑知识偏置,以保留知识特定偏置并编码拓扑语义。在四个大语言模型骨干上的实验表明,ORLF优于有竞争力的免训练与LoRA基线,平均精确匹配(Exact Match)与推理链准确性分别提升2.15%与4.29%,同时将顺序引起的性能标准差降低0.04%至3.01%。

面向大语言模型异构知识上事实一致性与顺序鲁棒接地推理的反事实基准与训练:论文配图
图1:TKFQA构建流程概览。我们首先构建跨越表格、文本段落和KG子图的反事实上下文与反事实证据链。随后生成问题,再进行自动验证和人工审查。