论文
证据门控问答的制度边界对齐
Regime Boundary Alignment for Evidence-Gated Question Answering
摘要
检索增强语言模型预计会根据检索到的证据进行回答,但实际上,当证据丢失时,它们通常会继续回答。我们将这一行为追溯到训练信号:以答案为中心的微调不会为不受支持的上下文分配目标,因此它无法区分放弃猜测的读者和猜测的读者,并且即使受支持的准确性提高,不受支持的答案仍保持在 100% 附近。我们引入了政权边界对齐(RBA),它可以针对同一问题和黄金答案的匹配变体来训练单个读者。读者经过训练,可以在上下文支持时给出黄金答案,包括当存在相互矛盾的证据时,并在正确的支持被删除时放弃;推理是普通的解码,没有验证器、阈值或机制标签。在三个种子的三个多跳 QA 数据集上,RBA 相对于以冲突为中心的训练,将不受支持的答案率降低了六十多个百分点,同时匹配其支持的准确性。在保留的 TriviaQA 检索未命中切片上,同一阅读器将不受支持的回答从 100% 减少到 1% 以下,同时还提高了受支持的准确性。这些结果表明,必须在支持边界的两侧学习证据门控答案。