论文

AI理解成像吗:面向计算成像任务的智能体AI系统基准

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

智能体系统Agent任务评测

摘要

视觉语言模型(VLM)与智能体AI在语义视觉任务上表现强劲,但它们能否处理计算成像背后的物理与逆问题仍不清楚。我们提出ImagingBench:跨五类20个计算成像任务的基准——光线与波动光学、图像信号处理、逆重建、计算感知与校准。ImagingBench评估三种互补设定:Expert(固定专家引导的逆重建)、Planner(规划器引导的逆重建)与Forward(前向系统仿真做一致性检查)。我们基准测试领先的专有与开源以图像为中心的多模态系统(包括Gemini、GPT与Qwen),并与代表性的任务专属非智能体基线比较。跨任务:智能体模型持续弱于专用方法——尤其在无透镜成像、事件重建、飞行时间成像与全息等计算感知问题上。规划器引导相对固定提示的Expert基线仅提供适度且不一致的增益。尽管模型常生成视觉上貌似合理的输出,其基于参考的保真度仍然差——揭示语义视觉能力与物理落地成像表现之间的实质差距。ImagingBench为度量该差距并跟踪智能体AI在计算成像上的进展提供统一试验台。

AI理解成像吗:面向计算成像任务的智能体AI系统基准:论文配图
图 1:ImagingBench 概述:我们的基准测试包含涵盖 5 个计算成像类别的 20 个子任务。每个面板都显示相应类别中的代表性任务,说明基准如何跨越从场景采集和光学编码到传感、图像处理、重建和校准的计算成像管道。