论文
SAGE:评估叙事中阐释性文学质量的分层框架
SAGE: A Hierarchical Framework for Evaluating Interpretive Literary Quality in Narratives
摘要
评估叙事的文学质量需要评估现有 NLG 指标无法衡量的解释维度(文化表征、情感深度和哲学参与)。我们引入了 SAGE,一个六层评估框架,它将基于规则的可观察文本属性评估与基于 LLM 的基于文化理论、情感理论和存在主义哲学的解释质量评估分开。每个解释层都通过具有独立交叉验证的多轮迭代 LLM 评估进行评估,在评估者模型中实现稳定的测量级可靠性(98.8% 收敛,> 94% 评估者间一致性)。经过对 100 个短篇小说的 600 次评估的验证,我们的核心发现是一个系统的能力边界:情感心理表征接近人类水平,而文化批判和哲学深度则表现出大约两倍的差距。 LLM 生成的叙事在所有三个层面上的得分甚至低于商业类型小说。我们将其解释为可从训练语料库中学习的模式可再现文学能力与需要立场的文学能力之间的界限,这些文学能力要求文化定位和哲学参与,而模式匹配本身无法提供这种能力。