论文
ParBench:可靠评估 LLM 并行代码翻译的基准
ParBench: A Benchmark for Reliable Evaluation of LLM Parallel Code Translation
摘要
现代计算密集型软件必须跨加速器、编程 API、编译器栈和可移植层不断变化的生态进行迁移,其中包括 CUDA、OpenMP、OpenCL 和 OpenMP target offload。大语言模型和自主编码智能体日益被提议用于此类迁移,但该领域缺乏可靠手段来衡量它们是否保留了使翻译在行为上有效的低级并行语义,包括线程索引、同步、内存管理、主机-设备协调以及 API 特定的执行结构。我们提出 ParBench,一个以内核为中心的基准框架,用于在可执行、可复现的条件下评估基于 LLM 的并行 API 翻译。ParBench 通过声明式基准规格固定周围的构建、运行和验证基础设施,仅要求模型翻译计算内核。它取材于多个开源 HPC 套件,覆盖 CUDA、OpenMP、OpenCL 与 OpenMP target offload 之间具有代表性的跨 API 翻译方向。为检验成功反映的是稳健翻译而非表面形式记忆,ParBench 引入了 AST 驱动、保持预期行为、经基线验证的源代码增强。对最先进的开源与专有 LLM 的评估显示,可靠的并行代码翻译仍存在持续障碍,包括方向不对称、多文件协调、API 适配不完全以及对源代码级扰动的不均衡鲁棒性。代码见 https://github.com/Scientific-Computing-Lab/ParBench。