论文

DS@GT ARC at LongEval:科学 QA 中的引文完整性和事实证据一致性

DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

模型评测评测方法与指标

摘要

本文介绍了 DS@GT ARC 向 CLEF 2026 LongEval Task 4 有关检索增强生成 (RAG) 的提交。在本次提交中,我们研究了应用于 RAG QA 系统的传统自然语言评估指标和引文完整性之间的差异。我们使用 Corrective RAG (CRAG) 和 CiteFix 根据基线和前沿模型基准 RAG QA 分数来评估纠正流程。虽然前沿模型最大化了答案相关性和流畅性分数,但我们的 RAGA LLM 作为法官诊断表明,前沿模型可以正确识别相关文档,而无需在答案生成中使用其上下文。相反,通过过滤生成前的块并强制执行生成后对引用材料的严格蕴涵,我们的纠正管道略微改善了引用 忠实性 和答案的证据一致性。我们建议,对值得信赖的 RAG QA 的评估需要奖励严格答案的证据一致性的指标。