论文
MSA-CITE:用于固定预算小模型推理的共同适应 LoRA 专家生态
MSA-CITE: A Co-Adapted LoRA Specialist Ecology for Fixed-Budget Small-Model Inference
摘要
紧凑语言模型通常通过保留单个训练后检查点并对其进行重复采样来部署。在这项工作中,我们通过将多个丢弃的检查点视为可组合资产进行部署来挑战这种做法。从单个 Qwen3-4B 主干开始,我们保留了四个冻结的 LoRA 分支,每个分支都源自不同的训练后轨迹。我们不是从一个分支中抽取四代,而是通过从每个分支中抽取一个完成样本来分配固定的四代预算。我们的方法,带有校准推理时间证据的多路径专家适应(MSA-CITE),通过将最终答案分组为等价类,通过总和校准导出的源先验对每个类进行评分,并根据确定性打破平局规则选择代表来处理结果组合。读出阶段不会从评估结果中学习,也不会引入额外的生成、验证器或重新排序步骤。在 200 个保留的数学项目上,四路径组合的准确率达到 65.5%,而最强的单分支基线的准确率为 62.0%。在 100 项主题不相交转变中,它达到 42.0% 与 40.0%。在分布条件下,相对于同质 SFT 和 Online-OPD 重复的改进是稳健的;针对最强基线和变化条件下的结果并不是决定性的。我们的研究结果提供了一个狭窄但具体的贡献:后训练的分支机构,即使没有共同训练,也可以集体有利于部署。