论文

一种频谱,两种资源:自回归预测中的数据内存扩展

One Spectrum, Two Resources: Data-Memory Scaling in Autoregressive Prediction

模型评测模型行为与机制分析

摘要

需要多少学习记忆才能从更多数据中受益?我们表明,这两种资源由正熵自回归检索源中的一个预测能谱控制。每个坐标贡献其查询概率乘以其未知 logit 的平方半径。将 $μ$ 写入得到的能谱,我们证明了 $n$ 预测块和最多具有 $2^B$ 值的学习状态的极小极大定律 $\mathfrak R^*_{\rm value}(n,B)\asymp_R Φ_μ(n^{-1})+Φ_μ(τ_B), Φ_μ(t)=\int\min\{x,t\}\,μ(\mathrm dx),$。数据集分辨率$1/n$;内存设置最佳位分配达到的水平$τ_B$。完整的曲线也恢复了正谱。能量维度配对至关重要:具有相同块能量和块维度边际的两个因果源具有不同的数据和内存指数。一个屏蔽的查询键注意力头学习路径和值,实现具有显式路由、格式和算术错误的规律。进一步的结果给出了双边算术假设下的指数自适应分配、有限精度实现和计算精度定律。实验恢复数据内存崩溃和耦合指数,解释路由和分配机制,并检查六个预训练模型尺度的仅权重量化。