论文

测量 Open 大语言模型 中的最大激活

Measuring Maximum Activations in Open Large Language Models

模型评测模型行为与机制分析

摘要

激活的动态范围是低位量化、激活缩放和稳定 LLM 推理的一阶约束。之前的工作描述了 2024 年之前的 LLaMA 风格模型的离群特征和大量激活,下游激活量化堆栈继承了该图片,而无需为后 LLaMA 开放模型繁荣重新审视它。我们提出面向部署的问题:在现代开放式 LLM 中激活可以达到多大,以及这个幅度在家庭、代际和训练阶段之间有何变化?在统一的管道(5000个样本的多域语料库、特定家族的标记化、跨嵌入的相同钩子、隐藏状态、注意力、MLP/MoE、SwiGLU门和最终规范)下,我们测量了来自8个开放家族的27个检查点的全局和分层最大值,这些开放家族涵盖密集、MoE、视觉语言、中间训练和指令调整变体。我们发现 (i) 在可比较的参数数量下,全局最大值跨越了近四个数量级,Qwen3.5 和 MoE 检查点在 10^2 到 10^3 范围内,Gemma3-27B-it 达到 ~7 x 10^5; (ii) 跨家庭和跨代比较打破了简单的单调标度; (iii) MoE 检查点的峰值比匹配规模的密集对应点低 14.0-23.4 倍,而残余流在 22/24 检查点中具有全局最大值。轻量级 INT-8 健全性检查表明,通过激活尺度选择,测量的最大值与低位重建误差存在共变。我们得出的结论是,最大激活幅度是与系列、架构和训练阶段相关的模型属性,而不是大小的简单副产品,并且应该在低位部署之前与任何开放权重版本一起测量和报告。该代码可在 https://github.com/clx1415926/Max_act_llm 上公开获取。