论文
随机性之源:大语言模型不确定性量化的综合研究
The Origins of Stochasticity: Comprehensive Investigations on Uncertainty Quantification for Large Language Models
摘要
大语言模型(LLM)的最新进展使其具备复杂推理与内容生成能力——但其固有随机性为保证预测可信度带来重大挑战。虽然传统不确定性分类学范式——如偶然与认知不确定性的二分法——提供概念基础——但常无法捕捉LLM生成的多组件、多阶段性质——且难以评估各种不确定性量化(UQ)方法的有效性。本文提出细粒度不确定性分类学——系统地把LLM不确定性归因到输入级、参数级、token级与解码过程来源。相应地——我们把既有UQ方法归为贝叶斯、集成、共识与单次方法。此外——我们引入覆盖多样生成设定与指标的综合评估框架。我们在TriviaQA、GSM8K与HumanEval等基准上对Qwen3、Llama 3.2与DeepSeek-V3三个知名LLM家族实证评估21种典型UQ方法。实验结果表明:(i) UQ方法的有效性对任务类型与生成设定敏感;(ii) 共识型方法(有类型的Deg与EigV)持续超越其他UQ方法;(iii) 更大模型规模与更低不确定性估计相关——提示LLM不确定性的经验缩放律。本工作弥合理论起源与实际部署间的缺口——为系统量化LLM应用中的不确定性提供通用诊断工具。
