论文
LABSHIELD:评测多模态模型的实验室风险识别与安全规划
LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories
摘要
人工智能正日益催化科学自动化,多模态大语言模型(MLLM)智能体正从实验室助手演变为自驱动实验室操作员。这一转变对实验室环境提出严苛的安全要求:易碎玻璃器皿、危险物质与高精度实验设备使规划错误或误判风险可能造成不可逆的后果。然而,具身智能体在此类高风险环境中的安全意识与决策可靠性仍未得到充分界定与评估。为弥合这一空白,我们提出LABSHIELD,一个旨在评估MLLM在危险识别与安全关键推理能力的真实感多视角基准。LABSHIELD以美国职业安全与健康管理局(OSHA)标准和全球化学品统一分类和标签制度(GHS)为基础,建立了覆盖164个操作任务、操纵复杂度与风险特征各异的严格安全分类体系。我们在双轨评估框架下评测了20个专有模型、9个开源模型和3个具身模型。结果显示,通用领域选择题(MCQ)准确率与半开放式问答(Semi-open QA)安全表现之间存在系统性差距,模型在专业实验室场景中平均下降32.0%,在危险解读与安全感知规划方面尤为突出。这些发现凸显了构建以安全为中心的推理框架的紧迫必要性,以确保具身实验室情境下自主科学实验的可靠性。完整数据集即将发布。
