论文

LabRobFail:化学自动驾驶实验室机器人故障分析基准

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory

模型评测基准与评测资源

摘要

在自动驾驶实验室中部署实体代理可以加速科学发现,但其可靠性受到化学实验的不可逆性和安全关键性的限制。故障数据稀缺和缺乏细粒度的评估协议进一步阻碍了进展。为了应对这些挑战,我们推出了 LabRobFail,这是一个以故障为中心的框架,用于学习和评估化学实验室中的机器人故障分析。 LabRobFail-Sim 在控制、物理和语义层面注入可控故障,从而能够构建 LabRobFail-Data,其中包含跨 70 多个任务场景的 20,000 多个轨迹、5 个故障类别和 11 种细粒度故障类型。 LabRobFail-Bench 评估六项功能,涵盖任务理解、故障检测、时间定位、严重性评估、故障分类和可行的纠正。我们进一步开发了 LabRobFail-VLM,这是一种领域专用视觉语言模型,可生成结构化故障诊断和恢复指令。在所见环境中,它实现了 90.83% 的故障检测精度和 77.21% 的时间定位精度,大大优于通用 VLM。当集成为实时监控器时,它可以将下游任务成功率提高 4-16 个百分点,展示了细粒度故障理解对于闭环恢复和可靠实验室自主的价值。我们的代码和数据可在 https://github.com/Su-ISE-2001/SciRobo 获取