论文
MERA:大规模代理系统的模型演化和路由以及技能适应
MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale
摘要
LLM 代理在单个任务中执行异构模型调用序列:某些调用需要仔细推理,而其他调用则需要结构化步骤,例如格式化或工具参数构造。先前的路由方法通过将简单的调用分配给更便宜的小模型并将困难的调用分配给大模型来利用这种不对称性。这些策略降低了推理成本,但它们使小模型的能力保持不变,因此可实现的节省仍然受到学生已经可以解决的工作的限制。 MERA 相反改进了小模型本身,使用单个模型调用作为适应单元。在每个周期中,MERA 都会重放失败的学生调用以获得经过执行验证的教师演示,将重复过程提炼到迭代更新的 SkillBook 中,并通过监督学习和可选的 GRPO 微调学生 LoRA 适配器。路由作为部署的支持机制:改进的学生在具有验证者支持的后备的成本校准路由器后面提供服务,并且仅当联合重放保持任务质量时才允许候选技能手册、适配器或路由器。根据经验,四周期适应将 Qwen2.5-Coder-1.5B 的通过率从 28.7% 提高到 49.7%,而保留的 HumanEval+MBPP 则为 49.7%。在验证者支持的回退下,部署的策略以始终 Luna 成本的 60.8% 保留了 88.3% 的通过率。在 TAU-2 上,经过微调的 Qwen3.5-2B 从 14/35 提高到 18/35,并与未调整的 4B 模型相匹配。这些结果表明,验证者支持的多周期适应可以提高小模型的能力,而不是仅仅围绕固定的学生进行路由。