论文
TraceLab:表征 LLM 服务的 编码智能体 工作负载
TraceLab: Characterizing Coding Agent Workloads for LLM Serving
摘要
编码智能体 正在迅速成为代理 LLM 的主要应用,但有效地为它们提供服务仍然具有挑战性。应对这一挑战的进展需要了解真实的工作负载模式,但此类分析所需的数据基本上不存在。现有的公共跟踪和基准测试无法捕获跨多个代理和模型系列的真实日常编码代理使用情况以进行服务系统分析。为了帮助填补这一空白,我们收集并发布了大约 4,300 个编码代理会话的跟踪记录,其中包含来自我们日常使用 Claude Code 和 Codex 的大约 350,000 个 LLM 步骤和 430,000 个工具调用。我们的分析表明,编码代理工作负载具有长自主循环、短输出的长上下文、多样化且重尾的工具调用以及高但不完美的前缀缓存命中率。这些发现指出了优化服务的具体机会,包括较低开销的工具调用、附加长度感知预填充、语义感知工具延迟预测以及围绕人为节奏差距改进的 KV 缓存管理。我们在 https://github.com/uw-syfi/TraceLab.git 发布了数据集、跟踪收集管道和分析代码,项目网站是 https://tracelab.cs.washington.edu。