论文
超越语义等价:用于LLM不确定性量化的逻辑图
Beyond Semantic Equivalence: Logical Graphs for LLM Uncertainty Quantification
摘要
大语言模型常以自信的口吻产出不可靠的输出,给安全敏感应用的部署带来关键挑战。语义熵等现有不确定性度量在语义等价层面捕捉一致性,却在很大程度上忽略不同答案之间的逻辑关系。结果,当生成的响应形式多样但逻辑兼容(例如仅在粒度或具体性上不同)时,它们倾向于高估不确定性并错误地标出幻觉。我们提出逻辑图不确定性(LGU),一个显式建模答案间蕴含与不相容关系的框架。LGU把概率质量沿蕴含链聚合到答案支持的最具体假设上,度量所得分布的熵,并对假设间的相互不相容施加惩罚。在多个问答基准与模型家族上,LGU在现有不确定性度量中平均排名第一,其最大增益——相对语义熵AUROC提升最高7.1%、AUARC提升3.5%——出现在采样答案逻辑结构化的问题上。