论文

超越参数整体:重建语言模型的记忆、可执行技能与剩余能力

Beyond the Parameter Monolith: Reconstructive Memories, Executable Skills, and Residual Assembly for Language Models

模型架构新型架构

摘要

语言模型系统可以分离上下文计算、持久存储和精确执行,而不是通过一个共享的参数系统更新所有功能。我们研究了 FEM-ASM,这是一种受有限元方法启发的组织,其中独立构建的文档状态和确定性可执行技能将类型化建议贡献给共享语言模型状态。显式残差运算符可以协调附加到公共接口节点的建议。我们通过受控实验和负结果来评估这个组织,而不是声称语言的物理有限元公式。无注意力多网格原型学习因果语言建模,但没有建立有竞争力的通用能力。版本化存储包含 52,809 个重构记忆元素,接近 17 亿浮点值预算;重建不完整,token 准确度约为 75\%。支持感知的词法索引使这些元素可以在来源控制的查询构造下寻址。对于可执行算术,位置结果观察相对于重复的全局结果向量显着改善了神经渲染,并且输出替换改变了模型的首选答案。有界附件演示进一步衡量了提供选定证据的效果,而无需建立加载整个数十亿浮点值的存储的效用。结果支持存储、执行和神经协调的分离,同时识别仅问题检索、无限制答案生成和端到端效率方面未解决的限制。