论文

超越诗歌:大型语言模型能否生成古典阿拉伯语 Maqamat?

Beyond Poetry: Can Large Language Models Generate Classical Arabic Maqamat?

模型评测模型能力评测

摘要

大型语言模型(LLM)在创造性文本生成方面表现出了强劲的表现,但它们产生具有文化基础和风格限制的文学形式的能力仍未得到充分探索。先前的工作主要集中在现代语言变体和诗歌上,而诸如马卡玛之类的古典散文传统仍然很大程度上未被研究。 Maqama 是一种古典文学体裁,其特点是押韵散文 (saj)、密集的修辞装饰和情景式叙事结构,使其成为评估大语言模型能否超越表面流利程度迈向更深层次文学能力的具有挑战性的测试平台。在本文中,我们提出了第一个利用大语言模型对 maqama 生成进行的受控评估研究,比较了零样本、少样本和基于规则的提示下的五种模型,并通过人工注释和大语言模型作为法官框架在修辞丰富性、saj 密度、结构连贯性和文体真实性等维度上评估输出。我们的结果表明,提示策略在文体质量中发挥着重要作用:少样本提示最能持续提高 Saj 密度,而其对修辞和连贯性的影响因模型而异,最强的模型(GPT-4o 和 GPT-5.4-mini)在这些维度上从基于规则的提示中获益最多,尽管零样本提示在所有五个模型中产生最高的总分。我们进一步观察了模型之间在风格上与阿拉伯语 maqama 惯例一致的系统差异,并通过第二位独立大语言模型法官、配对统计显着性检验和 saj 的非大语言模型代理衡量标准证实了我们的发现。