论文

检索主导的提取 QA 中的内在序列似然置信度:两个预先指定的否定,以及它们做什么和不归因

Intrinsic Sequence-Likelihood Confidence in Retrieval-Dominated Extractive QA: Two Pre-Specified Negatives, and What They Do and Do Not Attribute

模型评测鲁棒性、公平性与可信度评测

摘要

在提取式文档问答中,问题是从包含其答案的段落中生成的,因此检索可以恢复任何模式组合所能达到的 92-99.8%,无论其绝对准确性如何,置信驱动机制几乎没有什么收获。在专门领域语料库上微调开放语言模型会产生一个模型,其自身的置信度是一个诱人的控制信号:它可以决定哪些查询值得进一步调整,哪些答案值得信任。我们根据运行前确定的标准对这两种用途进行了评估,涉及四个 7-9B 模型系列,这些模型系列的适应使闭卷 F1 最多移动了+0.03,但都失败了:在预先指定的三步转移预算下,对所有四个系列进行蒸馏触发,并在其单模型试点中采用路由和弃权政策。在我们测试的每个正确性标准下,仅检索就恢复了最佳情况组合准确度的 92-99.8%,使路由器没有任何有意义的增益。序列似然信号相对于该模式是不足的——在注册标准下接收器操作特性曲线下的面积为 0.65-0.81——在适应之前和之后,标量重新校准没有改变,并且词元级温度重新调整没有一致地改善。更精细的诊断取决于正确性标准和答案长度;在我们可以测试的三种适应组合中,选择器消融显示,任何种子的置信项都没有统计上可检测到的下游益处;在 Gemma 上,删除它会改变选择器未能通过两个注册条件的情况。可用的产品是一组预先指定的负数,其依赖性明确。