论文
超越查询记忆化:结合查询分解与历史匹配的大语言模型路由
Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching
摘要
优化预测性能与计算成本之间的权衡是大语言模型(LLM)部署中的核心关注点。当前的路由方法主要依赖基于表面特征的查询到模型直接映射,容易陷入记忆化陷阱,导致在分布外(OOD)数据上泛化能力差。本文提出DecoR,一个新颖的路由框架,将路由任务重新表述为从历史日志中筛选相似查询的匹配过程,有效缓解记忆化陷阱。为提高匹配精度,我们提出查询能力解构方法,将语言表面形式与任务内在需求解耦,把匹配引向能力维度,使决策立足于任务本质属性。此外,我们构建了CodaSet,一个评估路由泛化能力的综合基准;实验结果表明,DecoR在分布内和OOD设置下均保持更优的准确率,同时显著降低推理成本。全部代码与数据见 https://github.com/lvbotenbest/DecoR。
