论文
POEMetric:人类的最后一节
POEMetric: The Last Stanza of Humanity
摘要
大语言模型(LLM)可以作诗,但他们离人类诗人有多远?在本文中,我们介绍了首个诗歌评价综合框架POEMetric,考察1)按照一定的形式和主题生成诗歌的基本遵循指令的能力,2)展示创造力、词汇多样性和特质、引起情感共鸣、使用图像和文学手段的高级能力,以及3)对诗歌整体质量的总体评价和对作者身份的评估。我们策划了一个人类诗歌数据集 - 7 种固定形式的 203 首英语诗歌,带有韵律、韵律模式和主题注释 - 并根据与人类数据相同的形式和主题尝试了 30 首 LLM 诗歌生成,总共 6,090 首 LLM 诗歌。基于 POEMetric,我们通过基于规则的评估和 LLM 作为法官来评估人类诗人和 LLM 的表现,其结果得到了人类专家的验证。结果显示,尽管顶级模型取得了较高的形式准确度(满分 5.00 中的 4.26,以 Gemini-2.5-Pro 为评委,下同)和主题对齐(4.99),但所有模型都未能达到与人类诗人相同的高级能力水平,人类诗人实现了无与伦比的创造力(4.02)、特质(3.95)、情感共鸣(4.06)以及对意象的熟练运用(4.49)和文学手段(4.67)。人类还在整体诗歌质量方面击败了表现最好的 LLM(4.22 vs. 3.20)。因此,诗歌的生成对于LLM来说仍然是一个艰巨的挑战。数据和代码发布于https://github.com/Bingru-Li/POEMetric。