论文

Agentic自主显微成像基准支持资格检验,但未必泛化到未见任务

Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks

智能体系统Agent任务评测

摘要

大语言模型代理正被开发用于控制广泛的科学表征工具,包括显微镜和同步辐射束线。关于物理基础设施的代理控制研究尚处于萌芽阶段,缺乏明确的工程方法来设计和优化代理系统。在设计和优化一个显微镜代理控制器时,研究人员不仅希望确保代理能够正确执行已知的任务,还希望其能够在未遇到的新任务上进行泛化。在这项研究中,我们开发了一个基准测试框架和跟踪记录框架,以揭示不同代理架构选择对显微镜任务性能的影响以及基准测试对于预测特定代理在未遇到的显微镜任务上的表现能力的限制。该框架用于评估一-、二-和三-代理图拓扑结构,五种语言模型(LLM)、阅读理解(RAG)和上下文参数,以及操作约束在53个显微镜基准测试中的应用。总共记录了105个代理配置、1,949个单独的测试运行和49,109次RAG检索。直接比较显示了不同配置之间的显著差异,包括延迟、词元使用、成本和失败模式。然而,基于代理架构和测试结果训练的替代模型未能可靠地预测代理在新、未遇到的任务上的表现。这些结果表明,这些基准测试对于资格认证、回归测试、诊断和直接比较非常有用,但当前的异构测试套件不支持任务无关的全局配置模型。

Agentic自主显微成像基准支持资格检验,但未必泛化到未见任务:论文配图
图 1:代理图拓扑和 MCP 工具界面的组织。 (a)–(c) 一个、两个和三个代理图以及分配给每个代理的一般职责。 (d) 通过六个 MCP 服务器公开的工具组,用于仪器控制、配方处理、几何和光学计算、图像分析、文件处理和 Python 执行。