论文

DeonticBench:规则推理的基准

DeonticBench: A Benchmark for Reasoning over Rules

模型评测基准与评测资源

摘要

对于 大语言模型 (LLM) 来说,使用复杂的、特定于上下文的规则进行推理仍然具有挑战性。在法律和政策环境中,这表现为道义推理:在明确的规则下对义务、许可和禁止进行推理。虽然最近的许多基准测试都强调短上下文数学推理,但很少关注长上下文、高风险的道义推理。为了弥补这一差距,我们引入了 DEONTICBENCH,这是涵盖美国联邦税收、航空行李政策、美国移民管理局和美国各州住房法的 6,232 项任务的基准。这些任务可以通过多种方式完成,包括用语言直接推理或借助符号计算。除了自由形式的思想链推理之外,DEONTICBENCH 还支持可选的基于求解器的工作流程,其中模型将法规和案例事实转换为可执行的 Prolog,从而形成正式的问题解释和明确的程序跟踪。我们发布了所有实例的参考 Prolog 程序。在前沿 LLM 和编码模型中,最佳硬子集性能在 SARA Numeric 上仅达到 44.4%,在 Housing 上仅达到 46.6 宏 F1。我们进一步研究了有监督的 微调 训练和符号程序生成的强化学习。尽管训练提高了 Prolog 生成质量,但当前的 RL 方法仍然无法可靠地解决这些任务。总体而言,DEONTICBENCH 为研究符号和非符号设置下现实世界中基于上下文的规则推理提供了基准。