论文
NinaXander:通过共享潜空间跨建筑家族构建冻结语言模型的可行性和局限性
NinaXander: Feasibility and Limits of Composing Frozen Language Models Across Architecture Families via a Shared Latent Space
摘要
在本文中,我们提出了 NinaXander,这是一系列组合语言模型,通过将来自不同架构系列的冻结语言模型层与单个经过训练的共享潜在适配器连接起来而获得。组合模型运行一个模型的第一层,使用适配器将生成的中间表示转换一次,然后运行另一个模型的其余层。一旦适配器被训练,无需重新训练即可获得在不同层连接的多个组合模型。本研究使用循环 RWKV-4-Raven-7B 和基于 Transformer 的 Tulu-Pythia-6.9b(缩写为 RWKV 和 Pythia)来检验来自不同家族的冻结模型是否可以事后重组。这些组合模型回答了多项选择题,而我们检查的那些模型生成了语法良好的文本。将 Pythia 的前 5 层与 RWKV 的其余 27 层相结合的配置将 Transformer 键值 (KV) 缓存减少了 84.4%,其精度与单独使用 RWKV 的精度没有显着差异。然而,在多项选择准确性方面,没有一个组合模型与父模型 Pythia 相匹配,并且 WikiText(训练领域之外的维基百科文章语料库)上的语言建模性能急剧下降。中间表示之间的对应关系也在一种有利的情况下获得,具有共享标记器、相同的深度和相同的隐藏宽度,并且不表明模型共享通用语义空间。