论文
上下文LLM级联的在线潘多拉魔盒
Online Pandora's Box for Contextual LLM Cascading
摘要
受大型语言模型 (LLM) 级联的推动,我们提出了一种在线上下文潘多拉魔盒模型,用于自适应查询和选择 LLM API。在每个时期,决策者都会观察请求上下文并面临两阶段决策问题。在查询阶段,决策者按顺序查询 API,其中每个查询都会显示生成的输出,并且决策者会产生(依赖于输出的)成本。在选择阶段,决策者选择生成的输出之一进行部署,并仅观察已部署输出的下游奖励。这种以输出为中介的反馈结构不同于经典的在线上下文潘多拉魔盒模型,在潘多拉魔盒模型中,打开盒子会直接显示其奖励。我们没有估计每个 API 的完整条件输出和成本分布,而是直接对预订索引进行建模并开发查询阶段的学习方法。具体来说,我们对经典韦茨曼策略引发的上下文保留索引函数施加参数结构。我们的策略将这些保留指数的广义矩量法 (GMM) 类型估计与这些指数和共享输出水平奖励评估器的 UCB 式置信界限相结合。在正则条件下,我们证明最终的策略在 $T$ 周期内实现了维度相关的 $\widetilde O(\sqrt T)$ 累积遗憾。