论文
超越单否定偏好:LLM-中心历史实体链接的多否定 DPO
Beyond Single-Negative Preference: Multi-Negative DPO for LLM-Centric Historical Entity Linking
摘要
大语言模型 (LLM) 最近显示出历史实体链接的希望,但此任务的偏好优化通常是每个训练实例仅使用一个负面候选者来制定。这会丢弃为同一提及检索到的其余候选者的信息。我们引入了多重负面直接偏好优化(MDPO),这是一种基于参考的成对目标,它将正确的实体与与每个提及相关的所有有效被拒绝的候选者进行比较。 MDPO 保留了 DPO 的 Bradley-Terry 公式,同时通过屏蔽、长度归一化的序列评分来利用完整的候选集。我们在 hipe-2020 和 newseye 上评估 MDPO,涵盖法语、德语、英语、瑞典语和芬兰历史报纸文本。实验表明,MDPO 比有监督的 微调 和单负 DPO 有所改进,对于 NIL 提及、语义歧义、OCR 噪声和历史困难名称的增益尤其显着。进一步分析解开候选生成和选择错误,表明候选检索仍然是端到端实体链接的关键瓶颈。这些结果表明,合并所有实例内的否定候选者是基于 LLM 的历史实体链接的简单而有效的改进。