论文

POLARIS:指导小模特写长故事

POLARIS: Guiding Small Models to Write Long Stories

模型训练强化学习

摘要

小型开放权重模型在长篇创意写作方面遇到了困难:它们生成的故事要么远远低于要求的长度,要么随着长度的增加,它们的质量显着下降,特别是与前沿模型相比。我们提出了 POLARIS(以 LLM 作为评委奖励和故事写作锚定参考注入的策略优化),这是一种低计算量 GRPO 配方,具有两个关键成分:前沿 LLM 评委,以结构化故事质量标准作为在线奖励,以及人类参考注入 (HRI),其中教师强制的人类编写的故事作为每个故事中的高奖励锚点。 GRPO 集团。通过将我们的训练方案应用于 Qwen3.5-9B,使用源自 100 个短篇故事选集和 4 个 A100 GPU 的大约 1.4K 个提示故事对的数据集,我们获得了 POLARIS-9B。在涵盖分布内和分布外提示和评分标准的五个基准测试中,POLARIS-9B 与更大的开放权重模型相比具有竞争力,同时更严格地遵循长度说明。盲法人类评估证实 POLARIS-9B 优于基础 Qwen3.5-9B,并且与 Qwen3.5-27B 相当。尽管仅对最多 4k 字的故事进行训练,但 POLARIS-9B 仍能在要求最多 3 倍训练长度的故事的提示上保持质量,在这种情况下,大多数开放权重模型的质量和/或长度依从性都会大幅下降。更广泛地说,我们的结果表明,长度泛化对于创意写作模型来说是一种有意义的压力测试,也是区分其他接近模型的有用镜头。