论文

使用分布对齐对抗 蒸馏 估计黑盒 LLM 不确定性

Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)在复杂推理和问题回答方面取得了快速进展,但LLM幻觉仍然是阻碍实际部署的中心瓶颈,特别是对于只能通过API访问的商业黑盒LLM。现有的不确定性量化方法通常依赖于计算成本高昂的多重采样或内部参数,这阻碍了实时估计,并且无法捕获黑盒推理过程中隐含的信息。为了解决这个问题,我们提出了分布对齐对抗蒸馏(DisAAD),它引入了一种生成判别架构来指导轻量级代理模型学习黑盒LLM输出分布的高质量区域,从而有效地赋予其知道黑盒LLM是否知道的能力。随后,我们使用代理模型重现黑盒 LLM 的具体响应,并基于证据学习估计相应的不确定性。大量的实验验证了我们提出的方法的有效性和前景,表明代理模型即使只占目标 LLM 大小的 1% 也可以实现可靠的不确定性量化。