论文
SpanUQ:大语言模型 生成的跨度级不确定性量化
SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation
摘要
不确定性估计不仅对于大语言模型(LLM)的可信部署至关重要,而且也是LLM一代自我完善的基础。然而,现有方法的运行粒度并不理想:词元级 分数缺乏语义一致性,而序列级分数无法定位错误。我们形式化了跨度级别的不确定性估计(SLUE),这是一项针对不确定性的自然粒度的新任务:语义连贯的文本跨度,每个跨度都传达一个可评估的含义单元。为了解决此任务,我们引入了 SPANUQ,这是一种轻量级(25M 参数)探针,可将昂贵的多样本推理中的不确定性知识提炼为 LLM 隐藏状态的单次前向传递。 SPANUQ 采用 DETR 式跨度解码器,通过 Beta 分布混合来同时检测跨度并估计其不确定性,并通过 Beta NLL 回归和对比排名目标的原则组合进行训练。我们构建了 SPANUQ-BENCH,这是第一个跨度级别的不确定性基准,包括 20K 提示、293K 带注释的跨度和源自多样本声明验证的连续软标签。在五个 LLM 主干上进行的实验表明,SPANUQ 始终如一地实现了最佳的跨度级别不确定性质量,优于最强的探测基线和所有基于采样的方法,同时速度提高了 10~20 倍。其基于 DETR 的跨度检测器达到 0.910 F1,超过最佳启发式 39.4%,实现了序列级方法无法提供的精确错误定位。相同的架构移植到跨越两个模型系列的五个 LLM,每个骨干网训练一个探针,并且我们还观察到序列级不确定性是部分可分解的,这表明跨度级估计将序列级作为一种特殊情况。项目页面位于 damon-demon.github.io/SpanUQ。