论文

超越相似性:中国古典历史互文性的扎根主体提取和专家裁决评估

Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories

模型评测基准与评测资源

摘要

互文性的计算方法已经从字符串匹配发展到神经检索,但它们的输出、相似性分数和平行段落列表可以识别文本在何处重复使用,而无需描述如何或为何重复使用。我们将细粒度互文性提取重新定义为一项代理任务,其中 大语言模型 (LLM) 完整读取两个文本单元,并且通过受约束的工具接口,必须将每个提议的重用基于两侧的精确字符跨度,并将其标记为重用的五维类型(形式、方面、源标记、功能、立场)。我们通过对《论语》与《汉书》的详尽比较来验证该方法,其中三位领域专家将汇集的多模型候选集判定为 2,533 个互文对的基准。根据这个标准,我们研究了 12 个 LLM,报告精度 (56%-93%)、同等质量下 51$\times$ 的成本差,以及它们的置信度校准情况。专家协议追踪了可靠性梯度:文本表面上清晰的维度被一致地注释,而那些需要推断意图的维度则受到争议,从而限制了此类注释支持的声明。将经过验证的提取器扩展到完整的二十四个历史(65,380 次比较,5,766 对)可恢复相似性分数无法表达的语料库级别结构。引文的解释性构成在十八个世纪中没有表现出系统性的变化,但同一段落的字面引用却越来越少。总体稳定,个别情况有偏差,这就是文化吸引力账户所期望的。我们发布了提取协议和专家评审的基准。