论文
黑盒 LLM 分类推理的层次结构感知监督不确定性估计
Hierarchy-Aware Supervised Uncertainty Estimation for Black-box LLM Taxonomic Reasoning
摘要
大语言模型 (LLM) 越来越多地用于科学决策支持,但在黑盒设置中可靠的置信度估计仍然很困难。我们研究了长尾生物多样性监测管道中黑盒 LLM 生成的分层分类推理的不确定性估计。使用开源工具 LLM 提取的代理特征,我们训练具有层次感知监督的轻量级监督估计器,以预测排名正确性。在三个工具 LLM 中,监督估计器在单个全局拒绝阈值下始终优于微观判别和选择性预测的标记似然基线,将微观 AUROC 从 0.57 提高到 0.75--0.80。最佳结果是通过特定等级的多头设计(H3)实现的,这表明当需要统一的弃权规则时,考虑分层输出结构非常重要。我们的代码可在 https://github.com/uoguelph-mlrg/hierarchy-aware-LLM-uq 上公开获取