论文

Internalizer:为284B语言模型生成文档专属LoRA

Internalizer: Portable Context-to-Parameter Mapping for Very Large Language Models

模型训练上下文与知识参数高效训练上下文工程

摘要

将上下文直接映射到 LoRA 适配器的超网络允许大型语言模型在其权重中承载该上下文,但之前的工作仅在最多 140 亿个参数的基础模型上证明了它们。我们展示了Internalizer,这是一种最先进的便携式上下文到参数映射超网络,它可以为冻结的 284B 参数 DeepSeek v4 Flash 生成特定于文档的 LoRA 适配器,该目标比之前的任何工作大两个数量级。它的大部分参数都位于与模型无关的主干中,每个基本模型只有薄的入口层和出口层,因此在移植到大型模型之前,它可以针对小型模型进行廉价的训练。在最多 4096 个 token 的未见文档上,生成的适配器达到 84.9% 的 top-1 和 97.8% 的 top-5 教师强制准确率,而基础模型的准确率分别为 63.4% 和 83.5%,上下文窗口中除了三字指令之外没有任何内容。一旦超网络经过训练,单个前向传递会将任何文档转换为此类模型的适配器,该适配器可以单独提供以提高速度,也可以与窗口中的文档一起提供以提高准确性 更远。