论文
Imaging-101:在科学计算成像上基准测试LLM编码智能体
Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging
摘要
计算成像——从间接、带噪测量中恢复隐藏信号——支撑跨科学学科的定量发现,但构建正确的重建管线需要深厚的领域专长,即使对领域科学家也很费工。我们提出Imaging-101:一个含57个经专家核验的计算成像任务的基准,跨六个科学领域,每个任务落地于一篇同行评审论文并规范化为标准化四阶段管线(预处理、正向物理建模、逆求解器与可视化);三条评估轨道(规划、函数级单元测试与端到端重建)探查智能体在完整管线上的不同能力。评估七个前沿LLM揭示:把编码智能体应用于计算成像存在超出通用编码基准的系统性挑战——横跨算法选择、物理约定处理与管线集成。这些发现凸显具体的capability差距,并指向技能增强、领域专用的智能体作为可靠计算成像辅助的实用路径。
