论文

退货还是修改?修订有助于检索增强 QA 时的学习

Return or Revise? Learning When Revision Helps Retrieval-Augmented QA

模型推理推理验证与自校正

摘要

我们考虑决定是返回现有的答案草稿还是使用检索到的证据对其进行修改,就像在答案修订系统中一样。草稿置信度估计当前答案是否正确,但决策需要估计指定修订的效果。对于离线训练和评估,我们在相同的正确性判断下对返回的草稿及其候选修订进行评分,这使得修复、损害和与预言机的差距可见。我们将这种配对效应称为可恢复性,并且我们训练策略在修改之前对其进行预测。在三个修订设置中的 25,870 个保留的开放域问题上,接受配对结果训练的评分员在准确性-修订率曲线下比所有九个 Llama 设置-种子拟合中匹配的草稿正确性评分员拥有更大的面积,并且在开发选择的阈值下平均获得 0.23--0.68 准确度点,仅在密集检索的训练运行中存在显着差异。由此产生的政策在不断修改的基础上进行了改进,平均缩小了三分之一以上的预言机差距,尽管它仍然应用了 38--46% 的有害修订。然而,当无草稿的标准 RAG 答案也可用时,在草稿和该答案之间进行选择对于 Llama 来说要强大约两分,对于 OLMo 来说要强四分,并且添加候选修订作为第三个选项不会产生显着的收益。可恢复性描述了一次修订;它作为一项可用行动的价值也取决于替代方案。