论文

HIPE-2026 概述:从多语言历史文本中提取人地关系

Overview of HIPE-2026: Person-Place Relation Extraction from Multilingual Historical Texts

模型评测基准与评测资源

摘要

此人是否曾经到过那个地方?如果是,是什么时候?从嘈杂的多语言历史文献中回答此类问题是 HIPE-2026(HIPE 评估系列第三版)的核心挑战。从命名实体识别和链接(HIPE-2020、HIPE-2022)转向实体之间关系的推理,HIPE-2026 的目标是两种基于时间的关系类型:$at$,表示某人在文档发布日期之前的某个时间点出现在某个位置;$isAt$,表示与该日期同时存在。本文介绍了评估活动的结果,该评估活动让 17 个参与团队面临法语、德语和英语三种语言的历史语言变异、OCR 噪声和间接上下文线索的挑战。这些数据集包括十九世纪和二十世纪的历史报纸文本,以及从早期现代法国文学文本中提取的令人惊讶的领域概括集。 HIPE-2026的一个显着特点是其三重评估框架,评估预测准确性、计算效率和跨领域泛化能力,反映了文化遗产领域大规模历史文献处理的实际需求。在 40 多个提交的运行中,结果揭示了从最先进的 大语言模型 到轻量级特定于任务的分类器的广泛策略,并强调了语料库规模历史关系提取所固有的准确性、效率和鲁棒性之间的权衡。系统描述、数据集和发现进行了介绍和讨论,提供了历史文档基于时间的关系提取的当前状态的详细图片。