论文
LLM可以充当历史学家吗?通过科举评价LLM的历史研究能力
Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination
摘要
虽然 大语言模型 (LLM) 越来越多地协助文本处理等历史任务,但其专业级历史推理的能力仍未得到充分开发。现有的基准主要评估基本知识广度或词汇理解,未能捕捉到历史研究核心的高阶技能,例如证据推理。为了填补这一空白,我们引入了 ProHist-Bench,这是一个以中国科举制度为基础的新颖基准,是跨越 1,300 年的东亚政治、社会和思想史的综合缩影。 ProHist-Bench 通过深入的跨学科合作开发而成,包含 8 个朝代的 400 个具有挑战性的专家策划问题,以及 10,891 个细粒度的评估标准。通过对 18 个 LLM 的严格评估,我们揭示了显着的熟练程度差距:即使是最先进的 LLM 也难以解决复杂的历史研究问题。我们希望 ProHist-Bench 能够促进特定领域推理 LLM 的发展,推进计算历史研究,并进一步揭示 LLM 尚未开发的潜力。我们在 https://github.com/inclusionAI/ABench/tree/main/ProHist-Bench 发布了 ProHist-Bench。