论文

面向PETSc中AI生成科学代码的智能体评估框架

An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

模型评测智能体系统智能体互操作协议基准与评测资源MCP

摘要

虽然大语言模型显着加速了科学代码的生成,但全面评估生成的代码仍然是一个重大挑战。传统的基准测试减少了对测试用例匹配的评估,这种方法对于 HPC 中的库代码来说是不够的,因为在 HPC 中,求解器选择、API 约定、内存管理和性能与功能正确性一样重要。为了解决这一差距,我们引入了 petscagent-bench,这是一个基于代理评估代理范式构建的代理框架。 petscagent-bench 不依赖静态脚本,而是部署一个工具增强的评估器代理,该代理编译、执行和测量由单独的待测模型代理生成的代码,编排跨五个评分类别的 14 个评估器管道:正确性、性能、代码质量、算法适当性和特定于库的约定。由于代理通过标准化协议(A2A 和 MCP)进行通信,因此该框架可以对任何编码代理进行黑盒评估,而无需访问其源代码。我们使用 HPC 的 PETSc 库在现实问题的基准套件上演示了该框架。我们对前沿模型的实证分析表明,虽然当前模型生成可读、结构良好的代码,但它们始终与传统的通过/失败指标完全忽略的特定于库的约定作斗争。

面向PETSc中AI生成科学代码的智能体评估框架:论文配图
图1:petscagent-bench架构:绿色评估Agent经A2A协议与紫色被测Agent通信,并经MCP协议访问编译与执行工具。