论文
LLM4LLM:以闭环Agentic优化弥合内核基准与真实部署
LLM4LLM: Bridging Kernel Benchmarks and Real Deployment via Closed-Loop Agentic Optimization
摘要
大语言模型已成为日益胜任低层代码与内核优化的智能体,但孤立的内核基准只能为语言模型推理中真正重要的部署行为提供代理指标。我们识别出一个基准-部署鸿沟:在独立测试环境中显得正确且快速的候选内核,在集成进真实推理工作负载后,可能表现出不同的性能、安全性或阶段行为。我们提出LLM4LLM,一个感知部署的闭环优化框架:从目标推理脚本出发,提取阶段感知的优化任务,用经验引导的情景式智能体进行搜索,并通过模型内验证接受补丁。在A100与H100 GPU上的十个语言模型推理工作负载中,LLM4LLM提升了每一个受评估模型的端到端延迟,在A100/H100上取得3.91倍/6.98倍的几何平均加速;作为内核层面的辅助证据,它还在KernelBench Level 2上取得最高2.745倍的几何平均加速。