论文

基于Shapley值的大语言模型输入不确定性局部化量化

Localizing Input Uncertainty Quantification for Large Language Models via Shapley Values

模型评测鲁棒性、公平性与可信度评测

摘要

随着大语言模型(LLM)日益融入高风险决策,可靠量化不确定性的能力已成为安全与信任的关键要求。然而,当前的不确定性量化方法主要在输出层面运作,往往无法区分不确定性究竟源于模型的知识欠缺,还是源于用户输入中的歧义。尽管以输入为中心的不确定性量化近来已成为一个有前景的方向,但它仍相对缺乏研究,且通常依赖粗糙的输入级信息。结果,用户得到的只是标量化的不确定性分数,对于应澄清输入的哪些部分才能提升可靠性,几乎没有可操作的指引。为解决这一局限,我们提出基于Shapley值的输入不确定性量化(ShaQ),一个对输入所引发的不确定性进行片段级归因的框架。我们的方法将输入中的歧义片段建模为合作博弈中的玩家,并利用Shapley值量化其贡献;Shapley值定义为:澄清每个片段联盟所获得的条件熵边际削减量的加权平均。与现有输入级方法不同,我们的公式化能够刻画片段间复杂的交互,并提供一种原则性的分解,使各归因之和恰好等于输入引发的全部不确定性。我们在AmbigQA和AmbiEnt基准上评估ShaQ,它取得了最先进的歧义检测性能。我们进一步在MediTOD上展示其实用性,表明ShaQ能够定位欠明确的临床话语,并促进高风险场景下的人机协作。总体而言,ShaQ改进了不确定性估计,并为有针对性的输入澄清提供了可操作的洞见。

基于Shapley值的大语言模型输入不确定性局部化量化:论文配图
图 1:LLM 与用户交互的不确定性方法的比较。 (左)输出水平不确定性方法提供置信度分数,但无法区分不确定性是由输入模糊性还是模型幻觉引起。 (中)总体任意不确定性方法可以识别不明确的输入,但缺乏本地化。 (右)ShaQ 将不确定性定位到各个跨度,从而能够有针对性地澄清不确定性的具体来源。