论文

超越查询记忆化:结合查询分解与历史匹配的大语言模型路由

Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching

AI 基础设施上下文与知识记忆模型网关Agent记忆

摘要

优化预测性能与计算成本之间的权衡是大语言模型(LLM)部署中的核心关注点。当前的路由方法主要依赖基于表面特征的查询到模型直接映射,容易陷入记忆化陷阱,导致在分布外(OOD)数据上泛化能力差。本文提出DecoR,一个新颖的路由框架,将路由任务重新表述为从历史日志中筛选相似查询的匹配过程,有效缓解记忆化陷阱。为提高匹配精度,我们提出查询能力解构方法,将语言表面形式与任务内在需求解耦,把匹配引向能力维度,使决策立足于任务本质属性。此外,我们构建了CodaSet,一个评估路由泛化能力的综合基准;实验结果表明,DecoR在分布内和OOD设置下均保持更优的准确率,同时显著降低推理成本。全部代码与数据见 https://github.com/lvbotenbest/DecoR。

超越查询记忆化:结合查询分解与历史匹配的大语言模型路由:论文配图
图1:分布内与分布外设定下各路由方法的性能与成本对比,用于评估基于查询分解与历史匹配的路由方案。