论文

深度学习中组合模型的分布式优化视角

A Distributional Optimisation Perspective on Combining Models in Deep Learning

模型优化模型合并

摘要

组合来自不同模型的预测可以提高机器学习任务的性能,但各个模型的训练以及用于组合它们的规则通常是通过临时方式单独选择的。分布优化(即优化发生在概率分布集上)的最新进展为有原则的联合训练提供了机会,将模型集合视为离散分布,其支持点将被优化,但这些方法的潜力尚未得到充分理解。在本文中,我们(1)将两种标准组合策略——集成和低秩适配器平均——作为熵正则化分布优化,观察到所得目标在集成情况下是凸的,但在适配器平均情况下不是,因此现有的收敛保证平均场朗之万动力学仅转移到前者; (2) 评估该任务的现有算法和新颖算法,包括变分梯度下降的功能变体; (3) 报告一项实证研究,涵盖综合分类任务和基于常识推理基准的大型语言模型的微调。