论文
用答案集编程与大语言模型做逻辑引导的数据抽取
Logic-Guided Data Extraction with Answer Set Programming and Large Language Models
摘要
当大语言模型(LLM)被用于从非结构化文本做语义数据抽取——从自然语言产生候选关系事实——它们在需要复杂组合推理与全局一致性的任务上仍不可靠。本文提出一个结合LLM抽取与答案集编程(ASP)的逻辑引导数据抽取框架:LLM产生候选事实,ASP执行验证、推理、一致性检查与控制。不同于对全部目标谓词独立查询LLM的既有管线,所提方法用ASP推理识别每个阶段逻辑上可采信的谓词并引导抽取查询。通过把LLM调用与ASP推导交错,框架无需进一步抽取即可推断逻辑蕴含的事实,并早期检测不一致。我们形式化该管线并证明:在温和假设下,它就最终抽取事实而言与基线方法等价,同时需要更少的LLM调用。我们还引入面向逻辑控制查询的缓存机制:利用合取查询在增量构建事实集上的单调性降低求解器调用。在ASP派生基准上的实验显示,框架减少LLM调用并通过抑制虚假输出改善抽取质量,展示了非单调逻辑编程对受控语义抽取的价值。