论文

SafetyALFRED:评估多模态大语言模型的安全意识规划

SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

智能体系统Agent任务评测

摘要

多模态大语言模型正日益被用作交互环境中的自主智能体,但其主动应对安全隐患的能力仍然不足。我们提出SafetyALFRED,它构建于具身智能体基准ALFRED之上,并增补了六类真实世界厨房危害。现有安全评估聚焦于通过脱离具身的问答(QA)设定识别危害,而我们评估了来自Qwen、Gemma和Gemini系列的十一个最先进模型,不仅考察危害识别,还考察通过具身规划进行的主动风险缓解。我们的实验结果揭示出显著的对齐鸿沟:模型在QA设定下能够准确识别危害,但这些危害的平均缓解成功率相比之下却很低。我们的发现表明,通过QA进行的静态评估不足以保障物理安全,因此我们倡导向优先考察具身情境中纠正动作的基准转变范式。我们在 https://github.com/sled-group/SafetyALFRED.git 开源了代码和数据集。

SafetyALFRED:评估多模态大语言模型的安全意识规划:论文配图
图 1:SafetyALFRED 评估流程的可视化。环境受到干扰而引入危险 (1)。然后,同一模型的两个单独实例评估场景:一个在静态 QA 设置中识别危险 (2a),而另一个则生成一个具体计划,该计划必须在完成任务之前减轻危险 (2b)。当 QA 任务中识别的危险也在具体任务 (3) 中得到缓解时,就会发生对齐。