论文
ReCal:基于 RL 的 LLM 路由的奖励校准
ReCal: Reward Calibration for RL-based LLM Routing
摘要
大语言模型 (LLM) 路由已成为通过动态模型和推理策略选择来利用多个 LLM 的互补优势的有效范例。最近基于强化学习(RL)的路由方法通过根据交互反馈优化路由策略进一步提高路由质量。然而,他们仍然难以在不同难度的异构任务下提供信息丰富且可比较的学习信号。在实践中,多个目标(例如,正确性、格式行为)被聚合成单个标量奖励,导致贡献分配不明确和优化信号相互冲突。此外,奖励信号在实例之间表现出显着的可变性,其中某些实例产生更高或更多可变的奖励,从而引入了优化偏差,该偏差有利于琐碎的样本而不是信息丰富的样本。为了解决这些问题,我们提出了 \textbf{ReCal},一个用于基于 RL 的 LLM 路由的 \textbf{\underline{Re}}ward \textbf{\underline{Cal}} 振动框架。我们首先引入具有按组件优势估计的分层奖励分解机制。我们进一步提出了一种分布感知优化策略,通过方差感知重新加权和每个数据集标准化来校准优化变异性。对七个数据集的实验表明,ReCal 持续提高了路由性能,并在基线上提高了训练稳定性。代码可在 https://anonymous.4open.science/r/ReCal 获取。