论文

固定权重,实时信号:冻结语言模型的前馈图

Dead Weights, Live Signals: Feedforward Graphs of Frozen Language Models

模型架构新型架构

摘要

我们提出了一种前馈图架构,其中异构冻结 大语言模型 作为计算节点,通过学习的线性投影通过共享的连续潜在空间进行通信。基于最近证明独立训练的 LLM 潜在空间之间的几何兼容性的工作~\cite{armstrong2026thinking},我们将这一发现从静态双模型转向扩展到端到端可训练多节点图,其中投影矩阵通过残余流注入钩子的反向传播来联合优化。三个小型冻结模型(Llama-3.2-1B、Qwen2.5-1.5B、Gemma-2-2B)将输入编码到共享潜在空间,其聚合信号被注入两个较大的冻结模型(Phi-3-mini、Mistral-7B),其表示馈送到轻量级交叉注意输出节点。在大约 12B 冻结的情况下,该架构仅具有 1760 万个可训练参数,在 ARC-Challenge 上实现了 87.3%,在 OpenBookQA 上实现了 82.8%,在 MMLU 上实现了 67.2%,分别比最佳单成分模型高出 11.4、6.2 和 1.2 个百分点,并且比冻结单模型上的参数匹配学习分类器高出 9.1 个百分点。 5.2分、6.7分。经过多个冻结模型边界的梯度流经经验验证是易于处理的,并且输出节点在没有显式监督的情况下开发跨第 2 层节点的选择性路由行为。