论文

政策大语言模型:大语言模型 实现对公共政策的卓越理解

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地融入现实世界的决策中,包括公共政策领域。然而,他们理解和推理政策相关内容的能力仍未得到充分探索。为了填补这一空白,我们提出了 \textbf{\textit{PolicyBench}},这是第一个评估政策理解的大规模跨系统基准(中美),包含广泛政策领域的 21,000 个案例,捕捉了现实世界治理的多样性和复杂性。按照布鲁姆的分类法,该基准评估了三个核心能力:(1)\textbf{记忆}:政策知识的事实回忆,(2)\textbf{理解}:概念和情境推理,以及(3)\textbf{应用}:在现实政策场景中解决问题。在此基准的基础上,我们进一步提出 \textbf{\textit{PolicyMoE}},这是一个领域专业混合专家(MoE)模型,其专家模块与每个认知级别保持一致。所提出的模型在面向应用的策略任务上表现出比记忆或概念理解更强的性能,并且在结构化推理任务上产生了最高的准确性。我们的结果揭示了当前 LLM 在政策理解方面的主要局限性,并提出了建立更可靠、以政策为中心的模型的路径。