论文
DUD:大语言模型 中可靠的不确定性量化的解耦更新动态
DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models
摘要
准确的不确定性量化 (UQ) 对于 大语言模型 (LLM) 的可靠部署至关重要,但传统的基于概率的指标通常无法捕获模型的真实认知状态。虽然最近的机械方法利用隐藏状态动态,但它们通常聚合残余流更新,混淆参数记忆(前馈网络)和上下文处理(注意力)的不同角色。我们认为,这种聚合掩盖了细粒度的机械冲突,例如记忆上下文错位,这是不确定性的基本指标。为了解决这个问题,我们引入了 \textbf{D}e Coupled \textbf{U}pdate \textbf{D}ynamics \textbf{(DUD)},这是一个通过噪声引起的因果干预显式解耦 FFN 和 Attention 贡献的框架。通过量化每个模块的独立恢复能力,我们构建了一个双流动态剖面来捕获模型的内部脆弱性。大量实验表明,DUD 在不确定性估计和校准方面均显着优于最先进的基线,同时表现出卓越的跨数据集泛化能力,验证了解耦动力学作为模型 忠实性 的稳健代理。