论文
POOL:相似查询上的不确定性传播
POOL: Propagated Uncertainty Over Lookalikes
摘要
黑盒大语言模型需要置信度分数来区分可能正确与可能错误的输出,使系统能优先安排人工复核、把不确定案例路由给更强的模型,或在开发数据上选择弃答阈值。然而现有置信度估计器面临成本-质量权衡:语言化置信度便宜但常过度自信,而基于采样的不确定性信息量更大但随每查询采样数线性扩展。我们提出POOL(Propagated Uncertainty Over Lookalikes),一个受群组检验(group-testing)启发、解决这一权衡的低成本框架。POOL对有重叠的查询词干聚类,在代表性中心点(medoid)上评估基础估计器,将置信度分数软传播到邻近查询,并选择性地评估分歧高的案例。我们用Hy@p实例化该框架,这是一个混合估计器,结合语言化置信度与由采样答案嵌入的负von Neumann熵计算出的光谱答案多样性。在来自三个数据集的六个领域和五个黑盒LLM上,Hy@5取得高于语言化置信度和Vn@10采样的平均AUROC,同时使用的采样数只有Vn@10的一半。POOL-Hy@5在节省19.3%–39.3%生成的同时保留93.5%–97.9%的AUROC。在改述密集的工作负载上,生成节省升至73%–76%,表明语义冗余可被用来降低置信度估计成本。