论文

渐进式教学对语言模型创意写作的影响

The Effects of Incremental Instruction Delivery on Language-Model Creative Writing

模型评测模型能力评测

摘要

大语言模型越来越多地用作交互式写作工具,用户可以在多个回合中开发故事、修改想法并引入新要求,而不是预先指定完整的概要。然而,大多数关于多轮指令退化的证据都来自具有客观可验证结果的任务,因此不清楚增量交互是否会以显式需求检查无法捕获的方式损害创造性工件。我们使用 160 个人类创作的跨六种类型的创意写作任务来研究这个问题,预先或在 5-9 个回合中逐步向六个不同的开放权重模型系列提出每个预期的规范,产生 960 个匹配对。渐进式交付减少了对明确约束的遵守,并在结构/连贯性方面产生了最大的写作质量下降。在观察到的遵守情况相同的产出之间,结构性差距仍然存在,这表明仅测量到的需求损失并不能解释观察到的结构性差异。我们将创意完整性定义为联合依从性和叙事结构的紧凑衡量标准;在增量交付下,模型保留了 71.2% 的完全创意完整性(95% CI [68.2%, 74.3%])。一项超过 50 个匹配对的三人评分人研究独立地恢复了结构/连贯性、工艺和流派有效性方面的全部优势,而自动评分仍然与汇总的人类评分呈正相关。这些发现表明,交互式创意写作系统不仅应该根据需求是否能够在对话中幸存下来进行评估,还应该根据不断变化的需求是否仍然一致地集成到最终的工件中来进行评估。我们的数据集、基准测试和源代码可在以下位置获取:https://github.com/solusops/SISTER-2026-Team19