论文
PrologMCP:面向LLM智能体的标准化Prolog工具接口
PrologMCP: A Standardized Prolog Tool Interface for LLM Agents
摘要
前沿推理调整的语言模型在深度演绎任务上仍然失败,并且通过扩展内部推理提高性能的成本也很差。符号委托提供了一种补充途径:语言模型翻译问题,而求解器则执行推理。然而,当前用于逻辑编程的自动形式化管道通常是与特定任务或代理相关的定制集成。我们介绍 PrologMCP,这是一个与任务无关的开源服务器,它通过模型上下文协议 (MCP) 将 Prolog 公开为有状态工具。其紧凑的工具界面、结构化错误报告和每个会话隔离使翻译-运行-检查-修复循环成为支持 MCP 的代理的可重用原语。我们在 PARARULE-Plus 的两个子集上针对标准和推理 LLM(Claude Sonnet 4.6、GPT-4.1 和 o4-mini)评估了使用 PrologMCP 增强的形式化代理:一个通用样本和一个针对自然语言推理的特定失败模式的更具挑战性的样本。在一般样本上,形式化器匹配或超过推理 LLM(精度 1.00 vs.\ 1.00 / 0.998),与标准模型相比收益最大(GPT-4.1 为 0.762)。在具有挑战性的子集上,形式化器仍然接近完美(1.00 / 0.99),而推理大语言模型则下降到 0.95 / 0.94。这些结果表明,通过 MCP 将推理委托给 Prolog 是扩展自然语言推理的稳健且可检查的替代方案。