论文
SEEK:通过 Adaptive ChunKing 进行语义证据提取以进行多语言事实检查
SEEK: Semantic Evidence Extraction via Adaptive ChunKing for Multilingual Fact-Checking
摘要
多语言事实验证需要相关且足够完整的证据来进行可靠的事实预测。然而,现有系统通常依赖于搜索片段、句子级证据或局部分段的段落,这可能会错过决定性的上下文并产生支离破碎的证据。为了克服这些限制,我们提出了 SEEK,一种带有自适应 chunkKing 框架的语义证据提取,通过识别语义主题转换和保留本地验证上下文,从完整的事实检查文章中构建连贯的证据块。使用多语言编码器对构建的块进行编码,然后使用 LoRA 适配器对多语言 LLM 进行微调以进行准确性预测。 X-FACT 和 RU22Fact 上的实验表明,SEEK 比语义分块提高了宏 f1 高达 10%,比句子分块提高了 19%,比搜索片段基线提高了 20%。证据完整性和重要性分析进一步表明,SEEK 保留了更丰富的验证上下文,并实现了更可靠的多语言事实检查。