论文

当推理监督受到伤害时:基于 TTCW 的长篇文学评论生成

When Reasoning Supervision Hurts: TTCW-Based Long-Form Literary Review Generation

模型评测基准与评测资源

摘要

长篇文学写作的自动评估仍然具有挑战性,因为通用的 LLM-as-Judge 方法可能无法完全捕捉与创造力相关的维度,例如原创性和灵活性。尽管托伦斯创意写作测试 (TTCW) 提供了一个结构化的创意框架,并且之前的工作已经证明了基于参考的 TTCW 成对评估,但不存在用于生成基于 TTCW 的长篇文学评论的大规模数据集。我们通过构建包含 263,911 个长篇故事的数据集来解决这一差距,每个故事都用标量分数和跨 14 个基于 TTCW 的维度的元综合评论进行注释。使用此数据集,我们在两种条件(有推理内容和无推理内容)下以 4B 和 8B 两种尺度微调 Qwen3 模型。结果表明,非推理微调具有更强、更稳定的性能,最佳设置达到了0.6820的评估分数。进一步的分析表明,推理监督模型更容易出现解析失败,通常会继续不相关或重复的推理式文本,而不是完成所需的 14 度量审查报告。这些结果表明,对于基于固定格式的评价生成,推理监督并不是直接有益的,即使在特定于任务的 微调 之后,精确的度量对齐评分仍然具有挑战性。