论文
迷失在历史时代? 大语言模型 的波兰历史 Matura 基准
Lost in Historical Time? A Polish History Matura Benchmark for Large Language Models
摘要
语言模型被学生广泛用作知识源,但基准很少评估其解释性历史推理。我们评估了波兰高中毕业考试 (Matura) 历史上八篇领先的 LLM——2023 年至 2025 年的三篇官方论文,包括简答题和扩展论文——并将模型表现与人类考生群体进行比较。尽管模型得分接近上限,但总分掩盖了不同的能力概况:不同任务类型、来源模式和地理范围的排名不稳定,波兰历史内容与全球历史内容的惩罚一致。定性错误分析揭示了两种反复出现的故障模式:源去上下文化,即模型根据源内容进行推理,而不是将其视为分析对象;以及时间迷失方向,即响应在历史上是错误的。本研究介绍了第一个基于波兰国家课程的 LLM 历史基准。