论文

EAA:用视觉语言模型智能体自动化材料表征

EAA: Automating materials characterization with vision language model agents

应用与实践智能体系统智能体互操作协议科学研究MCP

摘要

我们提出 Experiment Automation Agents(EAA),一个由视觉语言模型驱动的 Agentic 系统,旨在自动化复杂的实验显微术工作流。EAA 整合多模态推理、工具增强行动和可选长期记忆,既支持自主流程也支持交互式用户引导测量。系统构建于灵活的任务管理器架构之上,支持从完全智能体驱动的自动化到嵌入局部 LLM 查询的逻辑定义例程等多种工作流。EAA 还提供现代工具生态,双向兼容模型上下文协议(MCP),使仪器控制工具可跨应用被调用或提供服务。我们在先进光子源的成像光束线上演示 EAA,包括自动波带片对焦、自然语言描述的特征搜索和交互式数据采集。这些结果说明具备视觉能力的智能体如何提升光束线效率、减轻运行负担并降低用户专业门槛。

EAA:用视觉语言模型智能体自动化材料表征
图7:与实验自动化和图像分析相关的两项任务的模型基准测试结果。柱高表示平均值,误差棒的半长表示对每个模型在10次试验上计算的所测量的标准差。模型预测的温度(temperature)与推理努力(reasoning effort)被设为1.0。(a) GPT-4o、GPT-5、Gemini 2.5 Pro和Gemini 3 Pro Preview在被要求使用所提供的图像采集工具在方形网格上采集4张图像时的性能。“命中率”(Hit rate)指4×10次预期工具调用被完成的比例。“延迟”(Latency)显示智能体在每次试验中完成该任务所用的平均时间。(b)识别图像中标记物位置的准确率,在GPT-4o、GPT-5、Gemini 2.5 Pro、Gemini 3 Pro Preview和Gemma 3(27B)上测试。准确率以报告坐标相对真实坐标的误差来度量。(c)展示AI所看到的带有标记物的图像。