论文
基于Shapley值的大语言模型输入不确定性局部化量化
Localizing Input Uncertainty Quantification for Large Language Models via Shapley Values
摘要
随着大语言模型(LLM)日益融入高风险决策,可靠量化不确定性的能力已成为安全与信任的关键要求。然而,当前的不确定性量化方法主要在输出层面运作,往往无法区分不确定性究竟源于模型的知识欠缺,还是源于用户输入中的歧义。尽管以输入为中心的不确定性量化近来已成为一个有前景的方向,但它仍相对缺乏研究,且通常依赖粗糙的输入级信息。结果,用户得到的只是标量化的不确定性分数,对于应澄清输入的哪些部分才能提升可靠性,几乎没有可操作的指引。为解决这一局限,我们提出基于Shapley值的输入不确定性量化(ShaQ),一个对输入所引发的不确定性进行片段级归因的框架。我们的方法将输入中的歧义片段建模为合作博弈中的玩家,并利用Shapley值量化其贡献;Shapley值定义为:澄清每个片段联盟所获得的条件熵边际削减量的加权平均。与现有输入级方法不同,我们的公式化能够刻画片段间复杂的交互,并提供一种原则性的分解,使各归因之和恰好等于输入引发的全部不确定性。我们在AmbigQA和AmbiEnt基准上评估ShaQ,它取得了最先进的歧义检测性能。我们进一步在MediTOD上展示其实用性,表明ShaQ能够定位欠明确的临床话语,并促进高风险场景下的人机协作。总体而言,ShaQ改进了不确定性估计,并为有针对性的输入澄清提供了可操作的洞见。
