论文
与 LLM 专家在线学习,反馈有限
Online Learning with LLM Experts from Limited Feedback
摘要
我们研究了向 大语言模型 (LLM) 专家提示的自适应路由,以在反馈有限的在线环境中最大限度地提高响应质量。我们将其表述为一个强盗问题,在 $T$ 轮的范围内,使用代表专家的 $K$ 动作和编码提示的 $d$ 特征。我们提出了策略性选择和观察奖励的算法,以最大限度地减少遗憾。在全信息设置中,我们实现了$\tilde{O}(d T / \sqrt{m})$的遗憾,而在强盗设置中,我们实现了$\tilde{O}(d T \sqrt{K / m})$,其中$m \ll T$是反馈预算。我们的实验表明,我们可以从有限的反馈中有效地学习跨不同 LLM 的高质量路由策略。