论文
何时命名交叉脚本:蒙古世界历史实体协调的源头基准
When Names Cross Scripts: A Source-Grounded Benchmark for Historical Entity Reconciliation in the Mongol World
摘要
历史人物可能以不同的语言、文字和转录传统出现,而不同的个体可能具有高度相似甚至相同的名字。这使得历史身份协调不仅仅是字符串匹配或音译的问题。我们引入了 MHER,这是一种来源控制的基准,用于对来自蒙古世界的人名证明进行成对核对。 MHER 包含一个平衡的 396 对仅名称核心,涵盖 84 个主要历史人物,以及一个更严格的 160 对基于源的子集,该子集由按源提及的证据构建,具有实体不相交的开发和测试分割。在五个生成系统中,相对于仅名称输入,正确的基于源的证据将配对测试的准确性提高了 12.96 至 94.44 个百分点。在五个相同表面的不同人案例中,所有模型仅在名称上都失败了(0/25 模型项决策),而基于源的证据产生了 24/25 正确的解决方案,其余输出为弃权。仅上下文消融表明,历史描述通常带有大量身份信息,而明确表示错误的控制会产生显着较低的性能。我们还发现名称并不总是有益的:对于 Qwen3-8B,恢复表面形式会将十个原本正确的仅上下文区别转换为错误的身份合并。这些结果表明,历史实体协调不仅取决于表面对应,还取决于身份判断是否对出处控制的历史证据做出适当的反应。因此,MHER 为研究历史 NLP 中的证据使用、弃权和失败模式提供了一个受控框架。