论文

PTXBench:使用特定于架构的 PTX 进行 GPU 内核优化的基准测试和调整 LLM

PTXBench: Benchmarking and Adapting LLMs for GPU Kernel Optimization with Architecture-specific PTX

模型评测基准与评测资源

摘要

我们推出了 PTXBench,这是一个用于评估和调整 大语言模型 (LLM) 的基准,以使用特定于架构的 PTX 进行 GPU 内核优化。 PTXBench 衡量功能正确性、所选目标指令是否在运行时执行,以及跨 GEMM 的前沿库以及 H100 和 B200 GPU 上的注意力工作负载的加速情况。我们的评估表明,特定于架构的 PTX 能力仍然参差不齐:复杂注意力后向工作负载的成功率大幅下降,并且执行目标指令并不一定会转化为有竞争力的性能。没有评估模型始终与整个套件中的前沿库相匹配。我们使用监督 微调 进一步调整 Qwen3.6-27B。修复条件训练改善了多项任务,但泛化能力仍然参差不齐;除了数据集大小之外,数据覆盖范围、平衡性和推理教师的质量也很重要。 PTXBench 提供了一个可审核的测试台,用于测量和提高 LLM 利用不断发展的 GPU 架构的能力。