论文

MulRobBench:安全且符合安保策略的多模式无人机代理的决策级基准

MulRobBench: A Decision-Level Benchmark for Safe and Security-Policy-Compliant Multimodal UAV Agents

模型评测基准与评测资源

摘要

在支持物联网的智慧城市环境中,无人驾驶飞行器(UAV)正在从被动传感平台演变为网络物理决策者,必须尊重退化观察和模糊语言下的操作规则。现有的无人机和多模式基准涵盖空中感知、导航、协作和任务推理,但很少测试物证、协议约束和行动风险在关键决策中是否保持耦合。我们推出了 MulRobBench,这是一种用于视觉-语言-动作 (VLA) 无人机代理的离线协议条件基准,它将真实的无人机多模态观测、协议级安全策略约束和可审计决策合约中的动作级网络物理安全联系起来。该评估集包含 3,024 个样本,涵盖 17 个任务分类节点和 12 个度量评分维度,围绕上下文理解、多模式证据仲裁、退化感知推理和风险感知行动规划进行组织。 MulRobBench 报告受控语义分数以及针对策略合规性、格式、不安全操作、解析和维度级别有效性的严格结构诊断。在 17 个统一审核的模型中,最佳语义协议决策得分达到 0.5141,最佳严格平均评分维度准确度达到 0.1599。一项匹配的 20 个锚定模态去除研究改变了每个模型 4-15 个动作选择,显示视觉和文本输入都会影响决策,而最强的输入条件因指标而异。每维度和条件分析将模态信任选择、约束提取、强眩光、丢失数据和高熵算子速记确定为动作不稳定的主要来源。因此,核心挑战是退化证据、安全策略约束和风险承担行动的稳定耦合,而不是孤立的场景识别。