论文

$Φ$-Bench:大语言模型 能否设计为其提供支持的基础设施?

$Φ$-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them?

模型评测基准与评测资源

摘要

大语言模型 (LLM) 在推理和代码生成方面表现出了卓越的能力,这提高了它们帮助开发和优化为其提供动力的基础设施的前景。然而,现有的基准测试主要关注孤立的内核、预定义的运算符或预先指定的优化目标,因此无法评估 LLM 执行开放式、长期 LLM 基础设施工程的能力。为了弥补这一差距,我们提出了 $Φ$-Bench,这是一个用于系统评估 LLM 工程 LLM 基础设施堆栈的基准。 $Φ$-Bench 源自前沿研究中研究的优化问题,并以现实世界的代码存储库为基础,广泛覆盖了 LLM 基础设施堆栈,涵盖了不同复杂性的任务,从本地化内核级功能完成到长期实施和端到端系统优化。对前沿 LLM 进行的广泛实验揭示了他们当前在设计复杂的 LLM 基础设施方面的能力和局限性,为未来人工智能基础设施自主优化道路上仍然存在的挑战提供了见解。