论文
PerfReasoning:大语言模型在硬件性能推理中的表现如何?
PerfReasoning: How Well Do LLMs Reason on Hardware Performance?
摘要
性能建模是硬件设计和软件优化的核心,但构建这些模型需要对计算、数据复用、存储和移动进行结构化推理。我们提出了PerfReasoning基准,用于评估大语言模型作为直接性能推理者和性能建模代码生成器的能力。在给定工作负载、架构和映射规范的情况下,模型能够比较不同映射方案并预测芯片外通信量和缓冲区需求。最强的闭源模型在基于推理的问答任务上准确率超过90%,最佳开源模型达到82.4%。然而,模型构建难度极大:尽管GPT-5.6 Sol的通过率超过80%,其他所有配置的平均通过率低于15%,且不同运行间差异显著。针对任务的强化学习使一个4B参数模型的映射推理准确率提升15.7个百分点,而无需反馈的多轮自修正提示策略效果不可靠。PerfReasoning揭示了看似合理的架构推理与可靠性能建模之间的巨大差距。我们将公开发布该基准,以支持可复现的评估并跟踪未来进展。