论文
当智能体无法行动:多智能体LLM系统工具调用可靠性的诊断框架
When Agents Fail to Act: A Diagnostic Framework for Tool Invocation Reliability in Multi-Agent LLM Systems
摘要
由大语言模型(LLM)驱动的多智能体系统正在变革企业自动化,但评估工具使用可靠性的系统性方法仍不成熟。我们引入一个全面的诊断框架,利用大数据分析评估智能体系统的程序性可靠性,满足隐私敏感环境中以中小企业为中心部署的关键需求。我们的方法提供一个 12 类错误分类体系,捕捉工具初始化、参数处理、执行与结果解读中的失败模式。通过对横跨开放权重模型(Qwen2.5 系列、Functionary)与专有替代品(GPT-4、Claude 3.5/3.7)以及多样边缘硬件配置的 1,980 个确定性测试实例的系统评估,我们识别出可操作的生产部署可靠性阈值。我们的分析显示,程序性可靠性(尤其是工具初始化失败)构成较小模型的主要瓶颈,而 qwen2.5:32b 取得与 GPT-4.1 持平的完美表现。该框架表明,中型模型(qwen2.5:14b)在商用硬件上提供实用的准确率-效率权衡(96.6% 成功率,7.3 秒延迟),使资源受限组织能够经济高效地部署智能智能体。本工作为工具增强多智能体 AI 系统的系统性可靠性评估奠定基础设施。