论文
RuleWeaver:大语言模型 的以规则为中心的场景推理基准测试
RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models
摘要
大语言模型(LLM)越来越多地应用于专业领域,在这些领域中,有效利用领域专业知识通常需要对具体场景中的复杂规则进行推理。然而,现有的基准测试仅部分评估了这种能力,因为它们要么关注输出级指令约束,要么忽视规则在场景推理中发挥的独特作用。为了解决这些差距,本文引入了 RuleWeaver,一个用于评估以规则为中心的场景推理的基准构建框架。 RuleWeaver从语料库衍生的IF-THEN元规则开始,逐步将其增强为复杂的规则,并将这些规则组合成以规则为中心的场景QA实例。除了最终答案的正确性之外,RuleWeaver 还通过基于评分标准的答案质量、规则召回率和规则精度进一步支持流程级评估。对 11 个代表性 LLM 进行的实验表明,当前模型仍然难以应对复杂的以规则为中心的场景推理,即使是性能最好的模型也只能达到最大评分的 50% 左右。我们在此处提供代码和数据集:https://github.com/SharkSpicy-NLP/RuleWeaver。