论文

具有模型可学习性感知数据分配的联邦推理蒸馏框架

Federated Reasoning Distillation Framework with Model Learnability-Aware Data Allocation

摘要

数据分配在联邦大语言模型(LLM)与小语言模型(SLM)推理协作中起着关键作用。然而,现有数据分配方法未能处理协作中一个研究不足的挑战:双向模型可学习性差距——客户端SLM无法识别符合自身可学习性约束的高奖励样本以有效承接LLM知识,而LLM也难以挑选能在其既有数据之外贡献新知识的样本。此外,这些协作框架还面临另一关键挑战:与领域无关的推理迁移——现有推理迁移方法难以灵活适配本地领域数据,使SLM无法在本地数据分布内有效习得来自通用LLM的逐步推理能力。为应对这些挑战,我们提出LaDa,一个具有模型可学习性感知数据分配的联邦推理蒸馏框架。它引入模型可学习性感知的数据过滤器,依据每对SLM与LLM之间的可学习性差距自适应分配高奖励样本,有效促进双向知识迁移。我们进一步设计领域自适应推理蒸馏方法,通过SLM与LLM间的对比蒸馏学习,在过滤后的高奖励样本上对齐推理路径的联合概率,使SLM捕捉本地数据分布下的深层推理模式。LaDa可作为插件模块用于现有协作框架,依据模型可学习性差距调整知识迁移。

具有模型可学习性感知数据分配的联邦推理蒸馏框架
图3:LaDa框架概览。模型可学性感知的数据过滤器(Model learnability-aware data filter),基于每对SLM与LLM的双向可学性差距动态分配高奖励样本;以及域自适应推理蒸馏(domain adaptive reasoning distillation),通过对比蒸馏学习对齐推理路径的联合概率,实现每对SLM与LLM之间的域自适应推理能力学习。