论文

OSWorld-Science:学习和使用科学软件的计算机使用Agent的基准

OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software

智能体系统Agent任务评测长程任务评测

摘要

科学软件为基于视觉语言模型 (VLM) 的计算机使用Agent提出了严格的测试:完成研究工作流程需要解释专门的界面、操作科学对象并产生可验证的结果。因此,我们引入了 OSWorld-Science,这是一个基准和评估环境,它结合了具有科学意义的任务、基于工件的评估以及用于研究科学领域计算机使用的高效Agent Harness。该基准包含 12 个 VLM 和 146 个跨多个科学领域和软件配置的高质量任务,涵盖分子绘图和逆合成、病理图像分析、统计计算和物理模拟等工作流程。任务是通过专家建议和迭代的人-人工智能协同设计来制定的,并根据科学价值和难度进行选择。基于任务特定执行的评估程序检查应用程序状态和生成的工件,包括分子结构、分割掩模、绘图和数值结果,并对不完整的结果授予部分学分。我们的特殊工具集成了模型适配器、交互循环控制和轨迹记录,以支持模型和交互策略的比较。我们的结果表明,当前最先进的 VLM 具有强大的功能,在解决科学领域的关键问题方面仍然面临挑战。我们还分析了多语言、推理工作、上下文长度和其他因素的基准测试结果,并得出了一些重要的结论和方向来协助未来的发展。总体而言,我们提供了一个集成框架,将专家定义的科学目标与可验证的软件结果连接起来,从而能够对科学工作流程中的Agent能力和Harness设计进行系统评估。