论文
InferenceBench:面向AI智能体开放式LLM推理优化的基准
InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents
摘要
AI智能体日益被用来自动化研发任务,但现有基准通常在预定工作流或狭窄动作空间上评估它们。即使是名义上开放的任务,也常可通过检索一条知名配方加调几个超参数解决,使强力结果究竟反映真正的优化还是记忆的解变得不清楚。我们提出InferenceBench:智能体必须部署一个OpenAI兼容的推理服务器并优化LLM推理速度。每个智能体获得一个目标LLM、一张H100 GPU、一个优化场景与两小时墙钟预算。三个优化场景隔离推理的不同瓶颈(prefill延迟、解码延迟与并发请求吞吐),第四个同时平衡三者。跨15个前沿智能体配置:智能体可靠地优于朴素PyTorch基线(最高8.08倍),常匹敌或超过默认设置的服务引擎(vLLM的4.05倍),但仍低于同预算下的简单超参数搜索(最高11.53倍)。对智能体轨迹的定性分析显示:尽管智能体列举许多相关优化技术,它们压倒性地收敛到单一推理框架;只测少数几种不同配置,把剩余预算花在重复测量、修复或调超参上,而非探索实质不同的策略。这提示瓶颈不在领域知识,而在提出多样配置、系统评估并提交最佳解的能力。总体上,InferenceBench反映智能体在开放式AI工程设定中运作的能力——记忆的解只能带来有限改进。
