论文
人工智能诗歌的作者归属与审美评价:以俳句为例
Authorship attribution and aesthetic evaluation of AI poetry: a case study with Haiku
摘要
本文研究了当代大语言模型(LLM)对日本俳句的生成和人类评价,重点关注受限诗歌形式内的作者认知和审美判断。使用几次镜头提示策略,日语俳句是在一组异构的大型语言模型中生成的,包括开源和闭源系统、中型和大型架构、具有本地或改编日语支持的模型以及多语言专有模型。这些人工智能生成的俳句与人类书写的俳句相结合,并以问卷形式呈现给东京日本大学的学生。该调查评估了受访者是否能够区分人工智能生成的俳句和人类编写的俳句,以及哪些线索影响了他们的判断。不同型号的识别精度有所不同。 GPT-5、Gemini 2.5 和 StableLM-7B 的表现大约为机会水平(约 0.50),而 LLM-JP、Gemma-2B 和 LLaMA-2 显示出中等可检测性(约 0.59-0.67)。然而,识别度强烈依赖于项目。对流畅性、连贯性、诗意性和相关审美维度的评级预测了感知的人性,但不能预测正确的分类,表明与审美评价相关的归因偏差,并揭示了审美评价和真实作者身份检测之间的脱节。扩展分析还检查了世代约束遵守情况、参与者水平特征以及基于大语言模型的探索性俳句作者评估。总体而言,研究结果表明,随着大语言模型的提高,表面水平的创造性合理性可能会减少受限诗意环境中可靠的人类歧视。