论文

基于偏好定向多目标强盗的选择性集成

Selective Ensemble Based on Preference-Directed Multi-Objective Bandits

摘要

现代机器学习系统的选择性集成需要在有限的评估预算下选择有前途的候选模型,而下游任务通常仅指定对准确性、鲁棒性和推理等能力的部分偏好。这种设置自然会产生部分指定的线性偏好下的顺序决策问题。我们将其形式化为偏好导向的多目标老虎机(PDMOB),其中可接受的权衡由多面体偏好锥体表示。基于这个公式,我们引入了帕累托$C$-最优性,它恢复了标准帕累托最优性和单权重标化作为特殊情况。然后,我们提出了偏好定向置信上限(PrefUCB)算法,该算法维护方向置信区间来指导探索。我们分析了基于指标的遗憾和差距加权的遗憾,并为这两个标准建立了实例相关的对数界限,恢复了经典特殊情况下对地平线 $T$ 的最佳对数依赖。对大型预训练模型选择性集成任务和机构授权下的在线资产分配的实验验证了我们方法的有效性。