论文
超越单词边界:希伯来语共指基准和形态复杂文本的评估协议
Beyond Word Boundaries: A Hebrew Coreference Benchmark and an Evaluation Protocol for Morphologically Complex Text
摘要
共指解析 (CR) 是一项基本的 NLP 任务,对于信息提取、摘要和许多业务应用等长格式任务至关重要。然而,CR 方法最初是为英语与形态丰富的语言 (MRL) 的斗争而设计的,其中提及边界不一定与单词边界对齐,并且单个标记可能由多个照应词组成。 CR 建模和评估协议标准地假设,就像英语一样,单词和提及大多是一致的。然而,这种假设在 MRL 中不成立,特别是在 LLM 的原始文本处理和端到端任务的背景下。为了评估和应对这一挑战,我们引入了 {\em KibutzR},这是第一个现代希伯来语的综合 CR 数据集,这是一个富含复杂单词和代词附着词的 MRL。我们提供一个带注释的数据集,用于识别单词、子词和多单词级别的提及,并提出一种直接解决单词/语素边界差异的评估协议。我们的实验表明,当代 LLM 在希伯来语上的表现明显比在英语上差,并且在原始未分段文本上的表现也会下降。至关重要的是,我们展示了希伯来语相对于英语的相反性能趋势,较小的编码器的性能远好于当代解码器模型,为研究和改进留下了充足的空间。我们提供了希伯来语共指解析的新基准和分段感知评估协议,为其他 MRL 的未来工作提供信息。