论文

MiRD:通过错误覆盖风险分解进行开放式问答的可靠集值预测

MiRD: Reliable Set-Valued Prediction for Open-Ended Question Answering via Miscoverage Risk Decomposition

模型推理推理验证与自校正

摘要

可靠的集值预测提供了一种原则性的方法来减轻开放式问答(QA)中的幻觉,但现有的保形方法通常依赖于一个脆弱的前提:有限采样必须已经产生至少一个可接受的候选者,否则违反此条件的校准示例将被丢弃。在本文中,我们介绍了 MiRD,这是一个两阶段框架,它将总体错误覆盖分解为采样失败和条件选择失败。在第一阶段,MiRD 针对有限抽样在固定预算下无法产生可接受答案的概率建立了一个期望水平边际上限。在第二阶段,以采样成功为条件,MiRD 使用在整个校准集上定义的准入相关不合格分数来校准保形选择阈值,从而保持校准集的完整性。在三个开放式 QA 数据集和八个模型中,MiRD 控制抽样风险、条件选择风险和整体错误覆盖,同时产生比 PAC 式替代方案更严格的第一阶段界限,以及比仅成功校准更具适应性的预测集。