论文

LabOSBench:面向科学仪器控制的计算机使用智能体基准

LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control

智能体系统Agent任务评测长程任务评测

摘要

当前计算机使用基准主要聚焦虚拟化系统中的软件操作任务——而科学仪器场景要求对复杂界面的协同控制与反馈驱动的参数调整。但直接在物理高精度仪器上评估智能体不切实际:成本高、安全风险、可及性有限——且难以保证可复现评估。这促使需要保留科学仪器操作挑战、同时支持可扩展安全基准测试的仿真但现实的试验台。为此——我们介绍LabOSBench——建立在网页科学仪器仿真器套件上、面向多模态GUI智能体的挑战性基准。经浏览器直接操作——LabOSBench避免资源密集的OS虚拟化——同时支持灵活任务配置与基于执行的评估。具体地——LabOSBench跨八个仪器仿真器构建96个子任务——覆盖从样品装载、对准、参数调谐、数据采集到结果检查的工作流。我们在子任务与端到端层级评估通用视觉语言模型、专门GUI智能体模型与先进智能体框架。实验揭示:虽然既有智能体能完成许多结构化GUI子任务——它们仍在反馈驱动操作与长程工作流执行上挣扎。总体而言——LabOSBench为推进计算机使用智能体走向科学仪器控制提供可复现、低成本试验台。

LabOSBench:面向科学仪器控制的计算机使用智能体基准:论文配图
图 1:LabOSBench 概述。该基准测试在八种类型的科学仪器 Web 界面上评估计算机使用代理,其中代理接收自然语言指令和屏幕截图,执行 GUI 操作,并使用跨 96 个子任务的情节级和子任务级指标进行评分。