论文

FlashInfer-Bench:为AI驱动的LLM系统构建良性循环

FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems

智能体系统Agent任务评测

摘要

近期的进展表明,大语言模型(LLM)可以充当能够生成GPU内核的自主agent,但将这些AI生成的内核集成到真实世界推理系统中仍然具有挑战性。FlashInfer-Bench通过建立一个标准化的闭环框架来弥合这一差距,该框架连接内核生成、基准测试和部署。其核心是FlashInfer Trace,一种描述内核定义、工作负载、实现和评估的统一模式,使agent与系统之间能够一致地通信。FlashInfer-Bench基于真实服务轨迹构建,包括一个精选的数据集、一个稳健的兼顾正确性与性能的基准测试框架、一个跟踪LLM agent GPU编程能力的公开排行榜,以及一个动态替换机制(apply()),可将表现最佳的内核无缝注入SGLang和vLLM等生产级LLM引擎。利用FlashInfer-Bench,我们进一步评估了LLM agent的性能与局限,比较了不同GPU编程语言之间的权衡,并为未来的agent设计提供了见解。FlashInfer-Bench由此建立了一条实用且可复现的路径,用于持续改进AI生成的内核并将其部署到大规模LLM推理中。

FlashInfer-Bench:为AI驱动的LLM系统构建良性循环 配图
图 1:FlashInfer-Bench 架构。FlashInfer Trace 提供一个标准 schema,用于规定内核契约与语义,并传递实现与评估结果;FlashInfer-Bench Dataset 精选生产级 LLM 服务工作负载;flashinfer_bench.apply() 则将经验证最快的实现直接部署到 LLM 推理引擎中。