论文

Imaging-101:在科学计算成像上基准测试LLM编码智能体

Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging

智能体系统Agent任务评测

摘要

计算成像——从间接、带噪测量中恢复隐藏信号——支撑跨科学学科的定量发现,但构建正确的重建管线需要深厚的领域专长,即使对领域科学家也很费工。我们提出Imaging-101:一个含57个经专家核验的计算成像任务的基准,跨六个科学领域,每个任务落地于一篇同行评审论文并规范化为标准化四阶段管线(预处理、正向物理建模、逆求解器与可视化);三条评估轨道(规划、函数级单元测试与端到端重建)探查智能体在完整管线上的不同能力。评估七个前沿LLM揭示:把编码智能体应用于计算成像存在超出通用编码基准的系统性挑战——横跨算法选择、物理约定处理与管线集成。这些发现凸显具体的capability差距,并指向技能增强、领域专用的智能体作为可靠计算成像辅助的实用路径。

Imaging-101:在科学计算成像上基准测试LLM编码智能体:论文配图
图 1:Imaging-101 概述。 (A) Imaging-101 对大语言模型代理在天文学、生物学、化学和材料科学、地球科学、医学和物理学的科学计算成像任务上进行基准测试。 (B) 每个任务支持三个评估轨道:规划(方法/设计与参考计划)、功能级(每个功能的数值单元测试)和端到端(按图像质量指标评分的完整流程)。 (C) 专家监督的管道(在 Claude Code 的协助下)复制并重构每个参考代码库;在接受任务之前,领域专家会根据原始出版物验证复制内容。 (D) 接受的代码被规范化为标准化的四阶段计算成像管道(预处理、正向物理建模、逆求解器和可视化),生成在每个阶段验证的参考实现。 (E) 每个发布的任务都提供数据、参考源、计划文档、执行源代码、评估脚本和单元测试,直接支持三个评估轨道(完整目录布局请参见 A-B 节)。每个任务都附带一个执行的 Jupyter 笔记本,作为一个独立的教程,通过预先计算的结果遍历整个管道以进行交互式探索。