论文

PersLitEval:LLM 对波斯文学问题的细粒度基准和评估

PersLitEval: Fine-grained Benchmark and Evaluation of LLMs on Persian Literature Questions

模型评测基准与评测资源

摘要

尽管多语言能力令人印象深刻,但 大语言模型 (LLM) 在非英语语言文学知识方面的评价仍然很差。我们介绍 PersLitEval,这是一个包含 4,514 道波斯文学多项选择题的基准测试,涵盖拼写、文学手段、语法、词汇、构词法和概念理解等八个细粒度类别,源自 Konkur 大学入学考试的材料。我们评估了十种提示策略中的 6 个 LLM,揭示了三个任务难度级别之间显着的类别级别差异:模型在概念相似性任务上达到了更高的准确性,但在形式语言分析方面遇到了困难,事实证明,拼写和构词是所有模型中最难的。提示策略对表现有重大影响,解释性的少数例子可以产生最佳结果,特别是在正式语言类别上。错误分析确定了三种失败模式:语义理解差距、形式语言知识差距和计数/枚举错误,表明不同的类别需要不同的改进策略。