论文

面向企业应用程序的多代理系统的可扩展定制和部署

Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications

模型推理推理加速

摘要

基于 大语言模型 (LLM) 的多智能体系统在复杂推理和任务执行方面表现出强大的性能,支持广泛的企业应用。然而,由于特定领域的定制要求以及代理工作流程中的高延迟和推理成本,生产部署仍然具有挑战性。我们提出了一个统一的框架,用于在现实环境中定制和高效部署多代理系统。第一阶段,代理模型定制,结合了持续预训练、监督 微调 和偏好优化,使紧凑模型适应专业领域,同时保留强大的代理能力。第二阶段,推理优化,将 推测解码 和 FP8 量化与目标校准集成在一起,以实现经济高效的服务,同时将质量损失降至最低。在企业工作负载中,我们的框架可以实现快速域适应,并实现 4.48 倍的吞吐量加速,同时保持性能并提高长尾场景的稳健性。