论文

考虑重试带来的词元成本膨胀,优化Agent模型路由

Not All Tokens Are Equal: Inflation-Aware Routing for Agentic LLM Systems

AI 基础设施模型网关

摘要

当语言模型第一次尝试无法回答查询时,代理系统会重试,每次都会消耗额外的词元。这种重试开销在模型的每个词元价格所暗示的价格与完整工作流程的实际成本之间造成了差距。我们将这个差距称为\emph{词元膨胀},并将其定义为真实工作流程成本与单次调用成本的比率。 FrugalGPT 等系统基于后者,在困难任务上可能会低估实际成本超过 2 美元\倍$。我们使用 InflationAgent 来解决这个问题,这是一个四阶段路由器,它 (1) 跨模型层和任务类型系统地测量词元通胀,发现多跳问答的 7B 模型的通胀高达 $4.25\times$; (2) 引入了 CoT 分支熵 (CBE),这是一种完全根据局部推理计算的预执行难度信号,它预测 AUROC 0.887 的高通胀; (3) 通过最大化语义交换率 (SER) 来选择模型,该语义交换率将预期准确性除以预测的真实成本,并采用新的升级策略,在路由到更强大的模型之前丢弃失败的链。在固定预算下的 GSM8K 上,InflationAgent 的准确度达到 94.7%,而 FrugalGPT 的准确度为 91.0%,同时使用的词元减少了 31%,并且我们表明,将失败的推理链转发到 GPT-4o 会使其准确度降低高达 34.8 个百分点,从而验证了新的升级设计。