论文

一种适应模型可以解决所有问题吗?客户支持大语言模型的微调策略选择

Can One Adapted Model Do It All? Fine-Tuning Strategy Selection for Customer Support LLMs

模型评测模型能力评测

摘要

生产客户支持系统通常需要大语言模型支持多种技能,例如意图分类、问题回答、总结或工具使用决策。一个核心部署问题是,这些技能是否应该由单独的任务专家模型来处理,还是由通过多任务训练、顺序更新或模型合并训练的单个模型来处理。我们使用涵盖 5 个系列(Qwen3、Qwen3.5、Gemma-3、Llama-3.1 和 Mistral)的 13 个模型来研究这个问题,参数范围为 0.6B 到 32B,跨 8 个客户支持数据集,涵盖 4 个公共数据集和 4 个专有数据集,包含大约 74.5k 训练样本和 8.7k 评估样本。在固定的训练协议下,我们训练了 200 多个检查点。我们的实验表明,多任务完全微调是我们测试的每个模型大小的最强操作默认值。专业模型在目标任务上表现出色,但在脱离任务时性能往往会急剧下降,因此可靠的路由非常重要。顺序低秩适应 (LoRA) 比顺序完全微调更好地保留了早期技能,同时将专家与其基本模型合并可以提高任务外鲁棒性,同时较大模型的相同任务损失有限。最后,我们提供了在现实环境中选择微调策略的实用指南。