论文

XHotpotQA:多跳问答中跨语言知识构成的基准

XHotpotQA: A Benchmark for Cross-Lingual Knowledge Composition in Multi-Hop Question Answering

模型评测基准与评测资源

摘要

知识密集型多跳问答需要系统选择证据并组成相关事实,但多语言基准通常将整个示例翻译成一种语言。这隐藏了推理链内语言边界的失败。我们引入了 XHotpotQA,这是一个针对混合语言证据的跨语言知识构成的受控基准。每个实例都被建模为一个证据依赖图,其问题、桥梁证据、答案承载证据和干扰因素都有明确的语言分配。审计的资源包含 15,661 个训练实例和 7,405 个验证实例,并具有句子级支持监督和提供的干扰项。在验证中,99.81%的项目跨越问题到标准证据语言界面,95.60%使用不同语言的标准段落。在三个读者工件中,与部分对齐相比,完全问题证据不匹配与 Unicode 感知答案 F1 低 10.25 至 15.79 分相关,不同脚本证据的缺陷为 11.98 至 23.70 分;相应的适应选择器对比度为 1.71 和 1.78 点。因此,在这种提供的候选设计下,被评估的读者表现出比选择者大得多的与条件相关的缺陷。 XHotpotQA 为必须跨语言集成证据的基于知识的系统提供角色感知诊断、模块化评估和经过审核的测试床。