论文
块级权重空间结构在后训练仍然存在:一项针对大语言模型家庭的实证研究
Block-Level Weight-Space Structure Persists Under Post-Training: An Empirical Study Across LLM Families
摘要
现代大语言模型被部署为源自一组共享的预训练权重的后训练变体(基础、指令、聊天、代码)系列。我们提出了关于训练后如何转换权重空间几何的实证研究,涵盖四个架构系列(Qwen2.5、Llama-3.1/3.2、Mistral、Gemma-2)的八种配置。我们发现了一个粒度差距:训练后修改每个张量(291-339 个张量中的零个保持字节相同,因此基于哈希的重复数据删除实现了 0% 的节省),但保留了块级结构(平均余弦相似度超过 0.99,相对 Frobenius 距离保持在 0.13 以下)。因此,训练后充当结构化扰动,改变每个参数,同时保持块级几何体完好无损。该属性不是通用的:独立训练的专业化(例如,Qwen2.5-Coder)与一般基数的余弦相似度约为 0.64,表明权重空间的不连续区域。扰动幅度随模型规模、架构系列和训练后配方而系统地变化。作为一个实际应用程序,我们构建了 LinkerLLM,这是一个惰性加载程序,可以跨共存变体别名共享块,从而节省 18-48% GPU 内存,并在单个 24 GB 消费级 GPU 上启用多达 5 个 7B 参数变体。八种配置中的五种在 MMLU、ARC-Challenge、HellaSwag 和 WinoGrande 上保留了至少 94% 的非共享变体质量;其余三个(Mistral-7B、Gemma-2-2B、Llama-3.2-1B)各有一个低于阈值的基准(87-91%),我们透明地报告这一点,而不是根据单个阈值来控制块共享决策。