论文

从大语言模型蒸馏答案集编程理论

Distilling Answer Set Programming Theories from Large Language Models

模型评测基准与评测资源

摘要

从零编写答案集编程(ASP)理论是一项困难且耗时的任务。我们采用神经符号方法,研究在给定一个将求解器置于回路中的固定智能体框架时,模型能否蒸馏出完整且正确的理论。该协议与数据集无关:以单个提示和一个空文件作为起点,模型有1小时的时间限制来推导出完整理论。我们选择VQA作为应用领域,选择三个基准(CLEVR、GQA、CLEVRER),因为它们公开可得且并非平凡任务。为了研究解决该任务所需的模型规模,我们使用了九个不同的模型:四个前沿模型(Claude Sonnet 4.6、Claude Opus 4.7、GPT-5、DeepSeek V4 Pro)、两个中档模型(DeepSeek V4 Flash、gpt-oss-120b)和三个开放权重模型(qwen3.6-27b、gpt-oss-20b、qwen3.5-9b)。四个前沿模型中的三个在CLEVR上达到100%,在GQA上达到92.8%-98.8%;在CLEVRER上,Sonnet、Opus、DeepSeek V4 Pro得分为92.7%-95.3%。GPT-5在CLEVR上达到98.7%,但在GQA上降至41.8%,在CLEVRER上降至86.7%。加入来自其他数据集的手写参考理论,使其他三个前沿模型的变化不超过正负3.4个百分点,但使GPT-5的准确率下降3-19个百分点。我们发布代码、提示和蒸馏出的理论。

从大语言模型蒸馏答案集编程理论:论文配图
图 1:三个数据集的代表性示例。