HyDRA:异构 LLM 池的混合动态路由架构
HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools
摘要
生产 LLM 部署越来越多地维护异构模型池,跨越数量级的成本差异。现有的路由器做出二元强弱决策,并将学习到的参数与特定的模型身份相结合,每当目录发生变化时就需要重新训练。我们提出了 HyDRA(混合动态路由架构),这是一个框架,可以预测每个查询的细粒度、多维功能需求,并通过不足匹配将它们与配置定义的模型配置文件进行匹配。具有 K=4 个独立 sigmoid 头的 ModernBERT 编码器根据推理、代码生成、调试和工具使用对每个查询进行评分;然后,短缺匹配算法会选择功能满足预测要求的最便宜的模型。部署的预测器在生产中以 86 毫秒的平均 CPU 推理延迟运行,并且与模型目录完全解耦——添加或删除模型仅需要更改配置,并且零重新训练。在 SWE-Bench Verified(5 个模型池:GPT-5.4-mini、Claude Haiku 4.5、GPT-5.3 Codex、Claude Sonnet 4.6、GPT-5.4)上,Hydra 的可调短缺阈值跨越三个范围:峰值质量超过始终强劲的 Claude Sonnet 4.6 基线(75.4% 与 74.2% 分辨率)成本节省12.9%; iso-quality 与 Sonnet 相匹配,节省了 54.1% 的成本,比我们之前的内部二进制路由器(9.1%)提高了 6 倍;对于 3.2 点的质量交易,激进型将节省率提高到 72.5%。结果适用于 LiveCodeBench、BigCodeBench 和 tau-bench。 HyDRA 在 GitHub Copilot 的 VS Code Chat 自动模式下部署给所有用户,据我们所知,这是在 LLM 路由文献中首次展示了跨 CJK、欧洲和其他脚本系列的语言不变路由。