论文
使用匹配轨迹重放评估置信门控检索
Evaluating Confidence-Gated Retrieval with Matched Trajectory Replay
摘要
交互式语言模型代理使用置信信号来决定是否立即回答、检索额外证据(来自记忆或外部知识)或推迟。然而,信心通常是孤立评估的,而不是衡量它所触发的行动的轨迹级后果。我们提出了匹配的轨迹重放,这是一种用于比较置信度到动作映射的受控协议。该协议固定候选答案状态、证据点、预算和行动成本。我们使用它在 HotpotQA 和 MuSiQue 数据集上使用 Mistral、GPT 和 Qwen 模型,在多跳问答系统中将原始语言置信度与事后等渗校准进行比较。在相同的数字承诺阈值下,校准会改变智能体最终承诺回答的问题。在所有六个模型数据集对中,它将承诺答案的准确性提高了高达 41 个百分点。但是,它会减少覆盖范围并增加检索使用。 HotpotQA 的总体准确率提高了 15 个百分点,但 MuSiQue 的总体准确率下降了 17 个百分点。这些影响反映了向更有选择性、风险更低的操作点的转变,而不是改进的答案或置信度排名。在检索之前安装的校准图通过检索深度一和二改进了保留校准,但对于所有三个模型来说,其比深度三处的原始置信度更差。平均而言,额外的证据会有所帮助,但这种总体效应并不能确定置信度是否可以确定哪些单个事件将从另一次检索中受益。总而言之,这些结果表明,校准可以使承诺风险变得可解释,但它并不能估计另一次检索的预期收益。因此,检索需要单独的信息价值或效用估计。评估应报告保留的校准、风险覆盖率和检索成本。