论文
通过具有时变需求的受限老虎机进行在线 LLM 选择
Online LLM Selection via Constrained Bandits with Time-Varying Demand
摘要
大语言模型 (LLM) 越来越多地部署在边缘云推理系统中,以处理具有异构精度、延迟和成本概况的各种用户任务。为每个传入任务选择合适的 LLM 对于确保服务质量和高效的资源利用至关重要。然而,模型的异质性、随机和未知的性能特征以及随时间变化的任务需求使得静态选择策略不够充分。现实世界的部署通常会施加硬资源预算(例如货币支出限制)以及软服务级别要求(例如延迟保证)。这些限制给在线决策带来了额外的挑战。我们将这个问题表述为一个受约束的随机老虎机学习任务,其中学习者在包装类型(硬)和覆盖类型(软)约束下顺序选择模型,同时适应时变的任务需求。学习者在无法获取潜在奖励、成本或延迟分布的情况下进行操作,并且必须依赖部分反馈。我们开发了一种新颖的在线学习算法,该算法利用置信区间估计和需求预测来平衡奖励最大化与长期约束满足。我们提供理论保证,显示与具有完整信息的离线基准相比的次线性后悔和次线性覆盖约束违规。合成工作负载的实验结果证明了我们的方法在动态、资源受限的环境中的有效性和稳健性。