论文
学习基于多跳 QA 中选择性回答的证据充分性边界
Learning Evidence Sufficiency Boundaries for Selective Answering in Grounded Multi-Hop QA
摘要
仅当提供的证据支持答案时,基于证据的问答系统才应回答。在多跳 QA 中,这一要求很困难,因为部分证据可能会使不受支持的答案显得合理。我们通过证据充分性边界来研究选择性回答:对于同一个问题,模型应该在不支持或部分支持的上下文中放弃,当上下文首先变得足够时回答,并在添加冗余证据时保持答案稳定。我们引入了证据充分边界训练,这是一种生成原生训练框架,可构建有序证据链并直接监督弃权到回答的过渡。该方法结合了级别监督、边界翻转裕度、边界后稳定性和答案召回保护。我们从 HotpotQA、2WikiMultiHopQA 和 MuSiQue 构建证据链,然后使用链指标、原始 QA 实用程序和外部不可回答集上的不支持答案率来评估模型。通过 Qwen2.5-3B-Instruct 和 LoRA 适配,证据充分边界训练在测试系统中提供了最强的边界定位,翻转精度为 0.807,而 词元级 弃权基线的翻转精度为 0.781。它还在外部不可回答评估中实现了最低的总体无支持答案率,为 0.095,而相同基线的无支持答案率为 0.101,同时保留了具有竞争力的原始 QA F1。结果表明,当训练标记出拒绝让位于回答的证据水平时,有根据的选择性回答就会得到改善。