论文
剧透警报:叙事预测作为 LLM 讲故事中紧张度的衡量标准
Spoiler Alert: Narrative Forecasting as a Metric for Tension in LLM Storytelling
摘要
迄今为止,LLM 既未能生成始终如一的引人入胜的故事,也未能认识到这一失败——在领先的创意写作基准 (EQ-Bench) 上,LLM 的评委将零镜头人工智能故事置于《纽约客》短篇小说之上,这是文学小说的黄金标准。我们认为现有的标准忽视了引人入胜的人类故事的一个关键维度:叙事张力。我们引入了 100-Endings 指标,它逐句浏览故事:在每个位置,模型仅根据到目前为止的文本预测故事将如何结束 100 次,并根据预测与 真值 不匹配的频率来衡量张力。除了不匹配率之外,句子级曲线还产生补充统计数据,例如拐点率,这是曲线反转方向频率的几何度量,跟踪扭曲和启示。与基于标题的评判不同,100-Endings 正确地将《纽约客》故事排名远远高于 LLM 输出。基于叙事学原理,我们使用结构约束设计故事生成流程,包括故事模板分析、想法表述和叙事脚手架。我们的流程显着增加了以 100-Endings 指标衡量的叙事张力,同时保持了 EQ-Bench 排行榜上的表现。