基于本地LLM的节俭知识图谱构建:零样本流水线、自一致性与人工群体智慧
Frugal Knowledge Graph Construction with Local LLMs: A Zero-Shot Pipeline, Self-Consistency and Wisdom of Artificial Crowds
摘要
本文对一条用于知识图谱构建与利用的多模型零样本流水线进行实证研究,该流水线完全在消费级硬件上通过本地推理执行。我们提出一个可复现的评估框架,在自动化流水线中整合两个外部基准(DocRED、HotpotQA)、WebQuestionsSP风格的合成数据以及RAGAS评估框架。在500个文档级关系上,我们的系统零样本F1为0.70 ± 0.041,而有监督的DREEAM为0.80。文本到查询在200个样本上达到0.80 ± 0.06的准确率。多跳推理在500个HotpotQA问题上取得0.46±0.04的精确匹配(EM),在50个样本上RAGAS忠实度为0.96 ± 0.04。在流水线之外,我们研究面向困难多跳推理的多样性机制。在零温度下无法解决的181个问题上,自一致性(k=5,T=0.7)用单个混合专家(MoE)模型最多恢复23%的EM,而跨模型oracle(3种架构×5个样本)达到46.4%。我们强调一个一致性悖论:样本间的高度一致恰恰标志着集体幻觉而非可靠答案,这与Moussaïd等人关于群体智慧的工作相呼应。扩展到完整流水线(500个问题)时,自一致性(k=3)将EM从0.46提升到0.48 ± 0.04。置信度路由级联机制(Phi-4 → GPT-OSS,k=5)取得0.55 ± 0.04的EM,为所得最佳结果,其中45.4%的问题被重新路由。最后,我们表明将V3提示工程应用于其他模型无法复现在Gemma-4上观察到的增益,证实了特定的提示/模型交互作用。整个系统在单张RTX 3090上约5小时运行完毕,无需任何训练,估计碳足迹为0.09 kg CO2当量。