论文

从LLM蒸馏答案集编程规则用于神经符号视觉寻路

Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answering

模型推理推理验证与自校正

摘要

视觉问答(VQA)是回答有关图像的问题的任务,需要集成多模态输入和推理。将基于逻辑的表示合并到推理组件中的模块化方法比端到端训练的系统具有明显的优势,特别是在可解释性方面。然而,当任务需求发生变化时调整或扩展这些表示可能会给开发人员带来很大的负担。为了应对这一挑战,我们提出了一种从大型语言模型(LLM)中提取规则的方法。我们的方法促使大语言模型扩展最初的 VQA 推理理论,以答案集程序的形式表示,以满足任务的新要求。 VQA 数据集的示例指导 LLM、验证结果,并通过利用 ASP 求解器的反馈帮助纠正错误规则。我们证明我们的方法在不同的 VQA 数据集上都是有效的。值得注意的是,只需要几个例子就可以从大语言模型中得出正确的规则。我们的实验表明,大语言模型的规则蒸馏是传统数据驱动规则学习方法的一种有前途的替代方法。正在逻辑编程理论与实践(TPLP)中考虑。