论文
产品中的强盗:推理时的超参数优化
Bandits in Prod: Hyperparameter Optimization at Inference Time
摘要
许多生产系统只能通过在实时请求上使用配置并观察嘈杂的反馈来评估配置。现代代理系统就是一个突出的例子,具有推理时间选择,例如模型选择、检索深度、提示策略和解码温度,但通常没有代表性的验证数据。我们将此设置形式化为在线超参数优化(OHPO),并将其视为混合和条件搜索空间上的无限多臂老虎机。我们引入了 IMABO,这是一个通用框架,它将用于在已采样配置中进行选择的任何强盗策略与用于提出新配置的任何预言机相结合。我们用 IMOSS 实例化它,这是一种无需重新启动的随时策略,其活动集增长为 $t^β$,并证明预期累积分位数遗憾界限为 $O(p_ρ^{-1/β} + T^{(1+β)/2})$,其中 $β\in(0,1)$ 控制活动集增长,而 $p_ρ$ 控制提议的配置落在搜索空间顶部 $ρ$ 部分的概率。我们将 IMOSS 与三个实用的预言机相结合:树形结构的 Parzen 估计器、由每个坐标强盗驱动的现有突变预言机以及预训练的表格基础模型,所有这三个模型都比统一随机预言机基线有所改进。从调整经典机器学习模型到配置基于 LLM 的代理,IMABO 在各种 OHPO 设置中的遗憾方面均优于所有基线。我们的实现可以在 https://github.com/Tiime-Software/IMABO 上找到。