论文
具有 LLM 路由代理奖励的相关感知上下文强盗
Correlation-Aware Contextual Bandits with Surrogate Rewards for LLM Routing
摘要
我们研究相关臂的上下文强盗问题,并访问由机器学习模型产生的代理奖励信号,受到 大语言模型 (LLM) 路由等应用程序的推动。与仅依赖于老虎机反馈并假设跨臂条件独立的经典上下文老虎机不同,我们的设置允许依赖于上下文的臂间相关性和可能有噪音或错误指定的辅助奖励信息。我们提出了通过两种互补设计来利用此类替代奖励的算法。当代理信号可靠时,耦合奖励混合方法会汇集真实奖励和代理奖励,以加速学习,而解耦预测混合方法则为强盗反馈和代理奖励维护单独的估计器,并自适应地组合它们的预测。这种解耦产生了对代理错误指定的鲁棒性,在最坏的情况下恢复与仅奖励老虎机方法相当的后悔保证,同时在代理预测信息充足时实现改善的后悔。我们为这两种方法提供了理论上的遗憾分析,并在不同的准确性与成本权衡下在 LLM 路由基准上对其进行了评估。结果表明,与标准上下文老虎机基线和强大的静态路由方法相比,样本效率得到了提高,并且始终具有更好的准确性与成本权衡。