论文

语言模型的几何校准保角弃权

Geometry-Calibrated Conformal Abstention for Language Models

模型推理推理验证与自校正

摘要

当语言模型缺乏给定查询的相关知识时,它们经常会生成可能是幻觉的看似合理的响应,而不是承认对答案是不可知的。由于评估基准稀缺,对模型进行再训练以奖励承认无知可能会导致过于保守的行为和较差的概括性。我们提出了一个事后框架,即保形弃权(CA),改编自保形预测(CP),以确定是否放弃回答查询。 CA 对参与概率(即不弃权)和生成的响应正确的概率提供有限样本保证。重要的是,弃权决定依赖于预测置信度,而不是 CP 中使用的不合格分数,这对于开放式生成来说是棘手的。为了更好地将预测置信度与模型的无知性结合起来,我们引入了一种校准策略,使用模型中的表示几何来衡量塑造响应过程中的知识参与度。实验表明,我们显着提高了选择性回答能力,条件正确率达到 75%。