论文

ASP-Bench:从自然语言到逻辑程序

ASP-Bench: From Natural Language to Logic Programs

模型评测基准与评测资源

摘要

把自然语言规格自动翻译为逻辑程序是一项具有挑战性的任务,影响神经符号工程。我们提出 ASP-Bench,一个包含128个自然语言问题实例的基准,由64个基础问题构成,各有简单与困难变体。它评估把自然语言问题翻译为回答集程序(ASP)——一种重要的逻辑编程形式——的系统。它对 ASP 特性提供系统覆盖,包括 choice 规则、聚合与优化。每个问题配有参考验证器,检查解是否满足问题规格。我们沿七个大体独立的推理方面(优化、时序推理、默认逻辑、资源分配、递归、空间推理与定量复杂度)刻画问题,提供对建模难度的多维视图。我们使用基于 ReAct(Reason and Act)框架的 Agentic 方法测试该基准,该方法达到完全饱和,表明带求解器反馈的反馈驱动迭代细化是在 ASP 中为自然语言建模的可靠且稳健的方法。我们跨多次智能体运行的分析使我们能够洞察决定问题建模难度的因素。