论文

MatToolBench:现实世界材料科学工作流程中多模态Agent的基准测试

MatToolBench: Benchmarking Multimodal Agents in Real-World Materials Science Workflows

智能体系统Agent任务评测

摘要

多模态 GUI Agent在通用软件基准测试中取得了令人印象深刻的结果,但它们操作专业科学软件的能力在很大程度上仍未得到探索。在材料科学中,稀疏的特定领域网络数据、专门的接口和默认的工作流程约定造成了通用预训练无法轻易弥合的盲点。我们推出了 MatToolBench,这是第一个用于在专业材料科学软件上评估多模态 GUI Agent的真实环境基准,包括 10 个工具的 204 项任务,采用三种模式:GUI 操作、OriginPro 脚本编写和基于代码的数据库查询,所有这些都在 Windows 11 VM 内执行。每项任务都由领域专家分解为细粒度的子标准,从而实现可解释的部分信用评分;我们的多级评估流程的 GUI 组件的平均 F1 为 0.98。对于 OriginPro 图形生成任务,我们进一步进行了人类与大语言模型一致性研究,以验证多模态评审在二次审美评估中的使用。我们的实验表明,一般基准测试上的出色表现并不会转移到专业的科学工作流程中,而且这种差距不仅仅是一个视觉基础问题:失败源于特定领域的操作知识、科学软件的稀疏预训练覆盖、弱的跨工具工件切换以及仅在视觉上暴露的关键状态。即使最好的模型在 GUI 任务上也只能达到 25% 的成功率,在代码任务上也只能达到 45% 的成功率。因此,MatToolBench 可以作为数据稀缺、知识密集型科学工作流程的具有挑战性的诊断基准和真实环境测试平台。