论文

无限参数大模型:从实时数据生成并适应权重

Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data

模型架构新型架构

摘要

缩放定律认为,语言模型随参数和训练数据增多而增强;混合专家MoE架构借此取得显著成果,每个token只激活庞大存储参数库的一小部分。这种成功建立在静态预训练数据上。部署模型面对的世界不同:能使其更有用的许多数据不在训练集中,而在当前处理的实时交互中,例如用户提供的事实或纠正。传统模型训练后权重冻结,无法从这些数据中学习。运行时提供的知识与行为只能通过检索或指令放入提示,在每次请求中重读,再在请求结束后丢弃。我们研究怎样的架构可以通过把实时交互写入权重来学习。受MoE启发,我们提出无限参数大模型:紧凑超网络把运行时数据转为共享基础网络的低秩调制,使前馈权重从实时数据生成,而非存于固定参数库。以往权重生成器读取一次上下文后便冻结;我们则维护生成器潜在代码上的贝叶斯信念并在线更新,使有效权重在会话推进时从演化的信念重新导出,而非读取一次后固定。存储占用保持不变,但模型可编译的权重实际上无限。对运行时知识与行为,将它们承载在权重而非提示中,可以摊销计算、释放上下文窗口、跨轮次保留,并可能比上下文内使用更好地泛化。我们制定评估协议,将这些方面与上下文学习和检索直接比较。