论文
SciHorizon-eLab:把实验协议编译为可验证具身任务
SciHorizon-eLab: An Agentic Protocol-to-Task Compiler for Scalable Benchmarking of Scientific Embodied Agents
摘要
具身代理为自动化科学实验提供了一条有前途的途径,但其进展受到缺乏可靠和系统的评估环境的限制。现有的基于模拟的实验室基准在很大程度上依赖于手动任务工程,这使得将不同的科学协议系统地编译成大规模可执行和可验证的具身任务变得具有挑战性。为了应对这一挑战,我们引入了 SciHorizon-eLab,这是一种Agentic 协议到任务编译器,它将科学的具身任务构建制定为编译问题。给定科学实验的自然语言协议,SciHorizon-eLab 通过语义基础、可执行任务合成和多阶段基于模拟的认证,逐步将实验室协议编译为保留语义的具身任务。该系统生成基于语义的环境、可执行操作程序和步骤级成功规范,同时能够重复生成专家演示和执行跟踪。使用此管道,我们进一步构建了 该基准,这是一个即用型基准,包含跨不同实验室操作的 300 个经过认证的任务。它支持 HIL 任务执行、可重复的专家演示生成以及有序的步骤级评估。在代表性任务中,最强的策略平均成功率仅为 49.7%,进一步的评估揭示了人类和具身智能体协调方面的明显弱点。我们在 https://github.com/SciHorizon-elab/SciHorizon-elab 公开发布代码、基准数据和评估工具包。