论文
SAGE:基于本体论解释维度的基于 LLM 的分层文学评价
SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions
摘要
评估文学质量需要评估解释维度,例如文化表征、情感深度和哲学复杂性,这些维度无法直接进行计算测量。我们引入了 SAGE,一个分层评估框架,它将文学质量分解为基于本体的解释维度,通过结构化的 大语言模型 评估以及多轮迭代反思和独立验证进行评估。我们使用双模式评估跨三个分析层(文化、情感心理、存在哲学)验证了 100 个短篇故事(50 个经典作品、30 个低俗小说、20 个 LLM 生成的叙事)的框架。在 600 次评估中,该框架实现了 98.8% 的分数收敛性和超过 94% 的评估者间一致性,并且基于内容和基于元数据的评估之间具有近乎完美的模式不变性。统计分析揭示了一致的流派层次结构(Canonical > Pulp > LLM,所有 p<0.001),具有特定于层的歧视:文化批评和哲学深度表现出非常大的效应大小(Cohen's d>2.4),而情感表征显示较小的差距(d = 1.68),这表明情感模式比批判立场或哲学深度更容易从训练数据中学习。跨层相关性 (r=0.649-0.683) 确认三个维度捕获了经验上可区分的质量方面。这些发现表明,理论驱动的 LLM 评估可以实现测量级可靠性,并支持系统地识别当前生成模型在人类文学生产方面的不足,这对开放式文本生成的可扩展自动评估具有直接影响。