论文

用于LLM不确定性量化的保形预测和释义感知评分

Conformal Prediction with Paraphrase-Aware Scoring for LLM Uncertainty Quantification

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 的不确定性量化 (UQ) 旨在提供可靠的预测置信度测量,但当前的方法在保留意义的扰动下通常不稳定。语义等效的释义可能会导致预测置信度的显着变化,即使对于具有形式保证的方法(例如保形预测)也是如此。为了解决这个问题,我们提出了一个对语义改写具有鲁棒性的释义感知 UQ 框架。我们的方法在LLM隐藏状态上训练轻量级代理模型,并跨释义聚合其预测以构建标签方式的不合格分数。在分数可互换性下,保形校准保留边际覆盖范围。如果释义管道满足附加的分布对齐条件,则这种保证也可以在仅测试重写下成立。我们评估三种设置(正常、完全重写和半重写),它们分别对两个数据集、校准和测试数据集或仅测试数据集应用重写。在七个多项选择 QA 基准和多个模型系列中,我们的方法产生了紧凑的预测集,其经验覆盖范围通常接近名义目标,即使在半改写的设置中也是如此。 消融研究表明,学习代理占集合大小减少的大部分,而释义增强的训练和推理时聚合提高了改写下的稳定性。代码可在 https://github.com/Raina-Xin/PA_Score. 获取

用于LLM不确定性量化的保形预测和释义感知评分的原论文方法或结果图
图 1:先验分数对输入问题的改写或释义(表示为 $\mathcal{T}$)很敏感,从而产生更大的预测集(面板 A 和 B)。我们的 PA 框架通过代理模型聚合多个释义,以降低分数和预测集对改写的敏感性(面板 C 和 D)。