幂律图注意力:缩放点积注意力的精确概括,推理时的经验崩溃
Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference
摘要
来自 Power Law Decoder Representations (PLDR-LLM) 的 大语言模型 及其注意力,幂律图注意力 (PLGA),用学习的输入生成的双线性运算符 $G_{LM}$ 取代了缩放点积注意力 (SDPA) 的固定双线性形式,该运算符通过元素幂律从正张量 $A_{LM}$ 构建。该架构已完全指定,并根据固定参考版本进行了验证;主张被标记为定理、条件定理、测量或猜想。无条件:PLGA 恰好在 $G_{LM}=I$ 处包含 SDPA; $A_{LM}$ 和 $A_P$ 严格为正数,$A_{LM}$ 上具有 Perron-Frobenius 结构; DAG正则化器具有NOTEARS步行计数形式,正性阻碍了精确的非循环性;并且,在非共振(满足标准旋转频率)下,交换标准识别哪些算子保持相对位置依赖性。推理崩溃定理:演绎输出的精确输入不变性将推理崩溃为具有常数运算符的广义 SDPA。测量的不变性:相对波动$10^{-6}$及以下;扰动界限量化但不证明缓存的推理;组装的代理错过了解码余量。在释放的检查点上测量条件三阶段机制(旋转旋转、浓度、行图收缩)。全局 Gram 下的分块训练和评分都有明确的目标暴露;在测试样本上,块和顺序评分选择相同的答案,并在每项 5\times 10^{-5}$ 范围内就已发布的 TruthfulQA 概率质量指标达成一致。自组织临界性作为具有内在顺序参数的现象学框架进入;公开的主张成为可证伪的猜想。选定的校样芯在 Lean 4 中进行机器检查。