论文
DynaMiCS:使用动态混合的 微调 LLM 具有性能约束
DynaMiCS: Fine-tuning LLMs with Performance Constraints using Dynamic Mixtures
摘要
大语言模型 的多域 微调 需要提高目标域的性能,同时保留以前的功能,例如常识、指令遵循或安全评估。现有的数据混合策略依赖于固定的启发式或自适应规则,无法明确强制保留此类功能。我们提出了 DynaMiCS,一种动态混合优化器,它将多域 微调 作为约束优化问题。每次更新时,DynaMiCS 都会执行简短的特定领域探测运行,以估计局部跨域效应的斜率矩阵,捕获每个 微调 数据集上的训练如何影响每个评估域。然后,这些估计用于通过概率单纯形的优化来计算混合权重,目的是提高目标域性能,同时将约束域指标保持在参考水平的指定容差范围内。由于这些效应是通过有限差分而不是梯度来测量的,因此目标和约束不需要是可微分的,也不需要出现在 微调 数据中,并且可以直接指定为基准精度。在具有不同数量的目标域和约束域的场景中,以及基于损失或准确性的目标,DynaMiCS 比静态、动态、基于相似性和基于探测的替代方案实现了更强的目标域改进和更高的约束满意度,而无需参考模型、每个示例评分或手动调整权重。