论文
VibeServe:AI智能体能构建定制的LLM服务系统吗?
VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?
摘要
多年来,我们像构建其他关键基础设施一样构建LLM服务系统:单一通用栈、经多个工程师年的人工调优,意在支持所有模型与工作负载。本文押下相反的赌注:一个自动为不同使用场景合成定制服务系统的多智能体循环。我们提出VibeServe:首个端到端生成完整LLM服务栈的智能体循环。VibeServe用外循环规划并跟踪系统设计搜索,用内循环实现候选、检查正确性并在目标基准上测量性能。在既有栈高度优化的标准部署 setting 下,VibeServe与vLLM保持竞争——表明生成时特化不必以性能为代价。更有趣的是,在非标准场景中,VibeServe通过利用通用系统错失的机会超越既有系统:六个涉及非标准模型架构、工作负载知识与硬件特定优化的场景。这些结果提示基础设施软件设计空间中的另一个点:生成时特化而非运行时通用。代码见GitHub。
