论文
数值不稳定与混沌:量化大语言模型的不可预测性
Numerical Instability and Chaos: Quantifying the Unpredictability of Large Language Models
摘要
随着大语言模型(LLM)日益融入智能体工作流,其源于数值不稳定的不可预测性已成为一个关键的可靠性问题。尽管近期研究已证明这些不稳定性会带来显著的下游影响,但其根本原因与内在机制仍知之甚少。本文对不可预测性如何根植于浮点表示的有限数值精度进行了严格分析,追踪舍入误差如何在Transformer计算层中传播、放大或消散。具体而言,我们在早期层中发现了一种混沌的“雪崩效应”,微小扰动在此触发二元结果:要么快速放大,要么完全衰减。超越具体误差实例,我们证明LLM表现出普遍的、依赖规模的混沌行为,其特征为三种不同的状态:1)稳定状态,扰动低于依赖输入的阈值并消失,输出保持恒定;2)混沌状态,舍入误差占主导并驱动输出发散;3)信号主导状态,真实输入变化压过数值噪声。我们在多个数据集和模型架构上广泛验证了这些发现。
