论文

大语言模型 在理解现代中国诗歌的诗意逻辑方面表现好吗?

Do Large Language Models Perform Well on Comprehending Poetic Logic in Modern Chinese Poetry?

模型评测基准与评测资源

摘要

大语言模型 (LLM) 在广泛的自然语言处理 (NLP) 任务中取得了重大进展,但它们理解文学文本,特别是现代中国诗歌的能力在很大程度上仍未得到探索。中国现代诗歌独特的文学特征需要独特的推理形式才能有效理解。与传达清晰信息的传统文本不同,中国现代诗歌独特的“诗逻辑”需要超越表面语义分析的整体推理方法才能被理解。然而,当前的评估范式很大程度上忽略了这个关键维度。为了解决这一差距,我们提出了《牡丹》,这是第一个专门为评估中国现代诗歌的诗学逻辑而设计的基准。我们将诗歌逻辑定义为跨越诗、行、意三个层面的四个任务,并以《牡丹》为基础对六种主流的LLM进行了系统的评价和分析。我们在非思维和思维配置下评估这些模型。实验结果揭示了现有LLM在理解中国现代诗歌诗学逻辑方面的局限性,验证了《牡丹》的有效性和必要性。我们的数据和代码将可用。