论文

这句话是谁写的?评估 LLM 生成的中国古典诗歌的检测

Who Wrote This Line? Evaluating the Detection of LLM-Generated Classical Chinese Poetry

模型评测基准与评测资源

摘要

大语言模型(LLM)的快速发展将文本生成任务扩展到了文学领域。然而,人工智能生成的文学创作在文学界引发了日益突出的创作真实性和伦理问题,使得LLM生成的文学文本的检测变得至关重要和紧迫。虽然之前的工作在检测人工智能生成的文本方面取得了重大进展,但尚未解决中国古典诗歌的问题。由于中国古典诗歌独特的语言特征,如严格的格律规律、共享的诗意意象系统、灵活的句法等,区分一首诗是否由人工智能创作是一个巨大的挑战。为了解决这些问题,我们引入了长安,一个检测 LLM 生成的中国古典诗歌的基准,总共包含 30,664 首诗,其中 10,276 首是人类写的诗,20,388 首诗是由四个流行的 LLM 生成的。基于长安,我们对 12 个 AI 检测器进行了系统评估,研究了它们在不同文本粒度和生成策略下的性能差异。我们的研究结果凸显了当前中文文本检测器的局限性,它们无法作为检测 LLM 生成的中国古典诗歌的可靠工具。这些结果验证了我们提出的长安基准的有效性和必要性。我们的数据集和代码可在 https://github.com/VelikayaScarlet/ChangAn 获取。