论文

RGDT-Bench:规则管理决策及其理由的 LLM 推理基准测试

RGDT-Bench: Benchmarking LLM Reasoning for Rule-Governed Decisions and Their Justifications

模型评测基准与评测资源

摘要

我们研究规则管理决策任务 (RGDT) 中的推理,其中模型根据政策、合同和合规性设置的要求,将外部规则应用于案例事实并证明决策的合理性。除了标准数学和逻辑推理任务强调的演绎能力之外,RGDT 还需要解释规则及其适用性、评估证据条件、结合规则和例外情况下的判断,并提供可检查的理由。这些要求激发了评估决策及其陈述理由的基准。我们引入了 RGDT-Bench,跨四个任务轨道和八个支持的任务探针组合提供 202.1K 条件级监督槽,这些组合改变了对支持信息的访问。标签盲提取和确定性检查产生保证完整性的标签:来源引用的覆盖范围和所述决策理由的一致性。该基准将失败归因于四个流程层:规则使用、条件、证据和聚合,并检查最终结果。在可评估的正确答案中,六个评估的LLM和支持的任务探索组合中的保证不完整性平均为 40.2%。这种保证的不完整性会带来潜在的安全风险,并且仍然难以检测:现有的 17 名评估员中最好的评估员仅达到接受者操作特征曲线 (AUROC) 下任务平均面积的 57.69%(随机:50%)。为了解决这个困难,我们训练了一个带有权证监督的简单奖励模型。它在正确答案中实现了 69.24% 的任务平均 AUROC,比匹配的结果监督基线高出 10.37 个百分点(百分点),比现有最佳评估器高出 11.55 个百分点。除了完整性评估之外,该模型在几乎所有答案选择比较中都优于结果监督基线,支持 RGDT-Bench 对 RGDT 推理的保证监督。