论文

大语言模型 总是讲同样的故事吗?

Do Large Language Models Always Tell The Same Stories?

模型评测模型能力评测

摘要

大语言模型 (LLM) 的最新进展使得高质量散文的生成成为可能,但这些模型是否能够生成多样化或创造性的工件仍然是一个有争议的问题。在这项工作中,我们通过叙事相似性的框架研究了 LLM 生成的故事的多样性。使用对比框架和人类编写的故事数据集以及 r/WritingPrompts 的提示,我们利用人类评估和三种不同的自动注释方法收集了 10 个代表性 LLM 的叙事相似性判断。我们的研究结果揭示了一个明显的趋势:LLM 生成的叙述始终比人类编写的故事更加相似。我们证明,前沿模型特别集中于一种“平均”的通用叙事,该叙事近似于人类个体的故事,但缺乏人类作者的集体多样性。最后,我们表明常见的缓解策略,包括负面提示和温度调节,无法有效解决这种同质性问题。