论文
MADE:信念驱动的双代理协调,用于自主模型部署
MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment
摘要
LLM型代理商现已具备较强的通用能力。然而,他们仍然在处理特定领域的任务,从而激励集成外部工具来扩展他们的能力。开源社区提供了大量的人工智能模型,通常作为异构研究工件发布,而将它们转换为可立即调用的 API 成本高昂且耗费人力。因此,自动化模型部署对于弥合模型资源和工具可用性之间的差距至关重要,但它仍然是一项长期、多阶段的任务,尚未得到充分探索。为了应对这一挑战,我们引入了模型自动部署引擎(MADE),这是一个双代理协调系统。具体来说,给定模型资源,MADE 迭代地构建和验证部署工件,根据执行反馈更新其部署信念,并重新访问无效的上游工件,直到模型成功用作可供其他代理使用的随时调用的 API。我们进一步介绍 M2ABench,这是将模型转换为可调用 API 的任务的基准。 M2ABench 包含 122 个真实世界模型以及用于评估的标准化测试用例。实验结果表明,MADE的部署成功率为68.85%,分别比SWE-agent和OpenHands高出13.93和44.26个百分点。我们的代码和数据集可在 https://github.com/HITDiSC/MADE 上公开获取。