论文

你的机器人多久才会忽略你?人机协作中 LLM Orchestrator 的安全基准

How Long Until Your Robot Ignores You? A Safety Benchmark for LLM Orchestrators in Human-Humanoid Collaboration

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于通过自然语言界面协调机器人行为,但不存在基准来评估它们作为人机协作中的安全意识决策者的可靠性。与执行二元允许/拒绝决策的确定性安全系统不同,基于 LLM 的协调器表现出从过度合规(拒绝安全操作)到完全违反安全行为的合规范围。本文介绍了人机协作中 LLM 协调器的第一个安全基准测试环境,该环境构建在基于模型上下文协议 (MCP) 的架构上,具有基于 ISO 10218-2:2025 保护措施的安全不变量。该基准定义了五个可测试的安全不变量、四级合规分类法(正确合规、过度合规、合规不足、完全违规)和三层评估管道(文本提示、模拟传感器执行器循环和 Unitree G1 EDU 人形机器人上的物理验证)。我们报告第 1 层结果:在全上下文和滑动窗口预算条件下,在 40 个 100 回合会话中使用三个云后端(Claude Haiku 4.5、GPT-4o-mini、Gemini 2.5 Flash)和本地开放权重基线 (qwen3:8b),同时模拟和物理层仍在进行中。我们发现 (1) 模型系列决定了安全底线,因为 Claude 和 Gemini 保持或接近零违规,而 GPT-4o-mini 每个会话提交多达 13 个违规,(2) 上下文管理分离了两个故障轴,将每个云后端的平均行为问题减少了 42-57%,同时使 GPT-4o-mini 的违规几乎翻倍(每个会话 3.8 到 7.2),以及 (3) 比例合规性,将移动速度限制在规则规定的最大而不是拒绝,只有在双子座才会始终如一地出现;初步模拟层再现了模型排序和 GPT-4o-mini 故障模式反演。