论文

多代理路由作为集值预测:WildChat 基准和成本感知评估

Multi-Agent Routing as Set-Valued Prediction: A WildChat Benchmark and Cost-Aware Evaluation

模型评测基准与评测资源

摘要

根据自然语言提示进行工具和代理路由自然是一个集值预测问题:单个查询可能需要多个代理,而过度选择会增加执行成本。这里介绍的基准源自 WildChat,包含固定 12 个代理目录上的 3,000 个提示,在固定模式下具有 AI 辅助启发式标签,并受控重新平衡以进行多标签评估。该评估协议结合了集合级指标(精确度、召回率、F1、Jaccard 和精确匹配)、延迟、面向执行的能力覆盖模拟以及基于有序代理成本层的约束加权路由设置。比较方法包括最近邻匹配、线性多标签分类、依赖性感知基线、微调编码器、通过加权代理路由 (WAR) 确定性加权后评分以及零样本 LLM 基线。结果表明,受监督路由器的性能明显优于最近邻和零样本 LLM 路由。微调编码器实现了最强的无约束集精度,而线性多标签模型提供了最强的实用基线。在受限设置中,加权路由层在强监督评分器之上应用时可以提高实用性,并且在 Encoder+WAR 中观察到的增益最大。总体而言,基准和评估协议支持固定目录多代理路由中准确性成本权衡的可重复研究。