论文
Poller:LLM 适合评估诗歌理解任务吗?
Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?
摘要
由于中国现代诗歌的独特性,传统的自动评价方法已被证明不适合这种文学体裁。人工评估仍然可靠,但成本昂贵且不适用于大规模数据。在本文中,我们提出了 Poller (Poetry LLM Evaluator),这是一种利用 大语言模型 (LLM) 来评估诗歌理解任务的新方法。具体来说,我们的方法要求 LLM 扮演诗歌作者的角色,提供详细信息,从而采用诗人的视角来模拟人类的评价和判断。我们对多个 LLM 进行了全面的实验,评估了八个专业维度对诗歌的解释。实验结果表明,我们的方法有效地减少了 LLM 与人类之间的评估误差。特别是对于特定维度评估,与基线方法相比,基于 Poller 的 LLM 在修辞技巧和陌生化方面分别实现了 94.55% 和 89.53% 的误差减少。这些性能是传统的 LLM 评估方法无法达到的。多个 LLM 跨不同维度的实验结果验证了我们方法的有效性。这项工作弥合了自动化效率和人类专业知识之间的差距,为诗歌相关任务的自动化评估奠定了基础。