论文

超越事实知识:大语言模型 中的基准测试和学习步骤级程序规则推理

Beyond Factual Knowledge: Benchmarking and Learning Step-Level Procedural Rule Reasoning in Large Language Models

上下文与知识检索增强

摘要

大语言模型 (LLM) 擅长文本理解和生成,但仍然难以可靠地理解和大规模应用外部提供的程序规则。为了评估这种能力,我们引入了 RuleWorld,这是一个大型基准,它将规则重新表述为全局可重用的抽象单元,而不是特定于实例的事实。 RuleWorld中设置了单规则、并行多规则、多跳推理等多种场景进行综合评估。我们进一步提出了 DynaRule,一个端到端框架,它将给定的规则注入 KV 缓存,并将检索转变为内部的、可学习的、逐步的过程。具体来说,DynaRule 采用带有特殊 <search> 标记的堆叠步骤级注意力训练,以在推理过程中实现动态规则重新注意力和更新。这样,模型可以在每一步重新关注最相关的规则,动态替换过时的规则,以支持更稳定的多步推理。 RuleWorld 上的实验表明,现有的 LLM 在大型规则池下面临挑战,而 DynaRule 将平均 QA 准确率提高了 19 个点,并在 10K 规则下实现了超过 85% Recall@1,大幅优于强基线。我们在此处提供代码和数据集:https://github.com/SharkSpicy-NLP/Beyond-Factual-Knowledge。