论文

受哈密顿量启发的本地瘦身算子 Ansatz 大语言模型

A Hamiltonian-Inspired Local-Operator Ansatz for Slimming Large Language Models

模型优化模型压缩

摘要

密集线性映射承载了现代神经网络的大部分参数和计算负担,但它们的密集形式使学习耦合的组织变得隐含。量子多体物理学通过将全局哈密顿量写为局部项之和 \(\hat H=\sum_k\hat h_k\) 来组织指数级大算子。相同的结构原理是否可以承载学习的神经图谱尚不清楚。我们引入张量混合(MixT),它将密集映射表示为重叠局部张量运算符的本机可执行总和,而无需施加显式矩阵秩约束。局部项计数 \(N_T\) 设置有效的非局部性和算子复杂度,而替换的 Transformer 块的数量 \(N_B\) 将此结构坐标扩展到网络深度。对 Qwen3-8B 和 LLaMA2-7B 的测试揭示了一个广泛的可恢复区域,随后是一个突然的、特定于模型的边界,该边界对于 \(N_T\) 的变化非常稳定。准确性和产出分布统计数据跨越边界重新组织在一起;在 LLaMA2-7B 中,相同的深度分隔了层间几何漂移的两个缩放范围。直接执行的结构还减少了参数、算术、存储和内存。这些结果将局部和结构确立为十亿参数规模的学习线性映射的可行组织原则,并暴露了其对结构简化的容忍度的尖锐边界。