论文
两个调用击败了五个代理:针对本地语言模型的自我改进来评估多代理管道
Two Calls Beat Five Agents: Evaluating Multi-Agent Pipelines Against Self-Refinement for Local Language Models
摘要
多智能体LLM管道系统将任务分解为多个角色以进行更好的推理,但主要以大规模商业模型为基准。在本研究中,我们研究了 Parishad(一种涉及五个角色的结构化多智能体系统),将其部署在本地模型 Qwen2.5-7B-Instruct 上,在两个数据集:GSM8K(500 个问题)和 HumanEval(164 个问题)上进行比较,并与直接提示和两次调用自我优化进行比较。由于错误累积问题,多智能体系统使用 JSON 数据格式时,GSM8K 准确率从 75.0\% 下降到 45.0\%。使用明文格式,精度恢复到82.0\%。两次调用的自细化策略(V1)可以在 GSM8K 上实现 86.2\% 的准确率,同时词元使用率降低 7.4$\times$。然而,HumanEval 上的相同 V1 实现(直接准确度已经为 96.3%)会主动破坏性能(66.5%)。应用于 HumanEval 的任务感知门控重新设计 (V2) 将准确率保持在 95.1\%。我们的结果表明,通信格式和实现细节比架构复杂性更能决定结果,并且更简单的方法可以匹配或优于本地 7B 模型部署的多代理管道。所有代码和数据均已发布。