论文
使用 LLM 生成长格式轮廓阶段的多框架比较
A Multi-Framework Comparison of Outline Stages in Long-Form Generation with LLMs
摘要
长格式生成暴露了 大语言模型 的基本局限性。即使 70B 参数模型在 16k 词元输出时也表现出长度崩溃,并且多章节故事经常触发“迷失在中间”效应的属性漂移特征。 “先提纲,后写”的范式已被广泛采用,但现有研究评估的是最终写作而不是提纲本身,将两个本应解耦的评估对象混为一谈。我们构建了一个统一的头对头基准,涵盖 3 个生成粒度(单章、多章和全书)的 7 个代表性长篇生成框架,并提出了一个基于锚的 LLM-as-a-judge 协议,该协议直接根据 5 点锚定尺度的源文本评估大纲。在 21 个框架粒度单元中,没有一个框架占主导地位;性能取决于框架的内在输出形式和目标粒度之间的匹配。 SuperWriter在长度受限的单章模式下排名第一,但在全书模式下这种优势就会减弱。大纲端排名与写作端排名只有中等程度的相关性,支持大纲-写作解耦原则。计算约束将写入端评估限制为案例的子集;后续实验将扩大样本量并添加跨模型评估器,以实现更强的统计推断。