论文
SAFE:用于循证多跳推理的 LLM-as-Verifier 框架
SAFE: An LLM-as-Verifier Framework for Evidence-Grounded Multi-Hop Reasoning
摘要
多跳 QA 基准通常会奖励 大语言模型 (LLM) 的虚假正确性,即模型通过无效的中间推理得出正确答案。我们提出了 SAFE,一种 LLM 作为验证者框架,用于基于证据的多跳 QA。 SAFE 不是仅判断生成后的最终答案,而是通过根据提供的段落和先前的推理轨迹检查中间步骤来验证生成过程中的推理。为了使这个过程可检查,SAFE 将推理分解为原子的、以证据为基础的单元,并用知识图 (KG) 三元组表示。在训练时,SAFE 在基于 KG 的约束下验证基准监督,并构建可靠的验证者训练数据。在推理时,外部验证器检查每个生成的步骤,识别无效推理,并在错误传播之前提供纠正反馈。在三个多跳 QA 基准测试中,SAFE 的准确率平均提高了 8.8 个百分点。这些结果表明,基于证据的多跳 QA 受益于将基于 LLM 的评估从事后答案判断转变为逐步推理验证。