论文
选择性问答的渐近风险校准
Asymptotic Risk Calibration for Selective Question Answering
摘要
大语言模型 (LLM) 可能会生成流畅但不正确的答案,这使得不确定性量化对于可靠的问答非常重要。然而,启发式不确定性分数无法完美区分正确的预测和错误的预测,并且直接应用固定的不确定性阈值无法对接受的答案中的错误率进行统计控制。为了解决这个限制,我们提出了 A-CRC-QA,一种用于不确定性感知选择性问答的事后校准框架。所提出的方法将选择条件误差控制重新表述为线性期望约束,并应用受共形风险控制启发的单调经验风险校准程序。由于所产生的实例损失相对于接受阈值通常是非单调的,因此我们的框架目标是渐近风险控制而不是有限样本风险控制。 A-CRC-QA 与模型无关,不需要额外的训练,并且可以与不同的不确定性估计器结合使用。 CoQA 和 MedMCQA 的实验证明了其对开放式和封闭式问答的适用性,与未校准和基于置信区间的基线相比,在接受答案的可靠性和答案保留之间实现了有利的权衡。