论文
GuardianBench:面向具身AI潜在情境风险的同场景指令对比基准
GuardianBench: A Same-Scene Instruction-Contrastive Benchmark for Latent Contextual Risk in Embodied AI
摘要
在具身AI中,安全风险可以是潜在的:一条良性指令与一个安全场景只有在组合时才变得危险。先前工作通过改变视觉上下文或评估执行时动态来推进具身安全,但固定场景、只变化指令这一互补轴仍然探索不足。我们提出GuardianBench,一个扎根于国际安全标准的指令对比基准,通过3,024个指令-场景样例来隔离这种潜在情境风险,这些样例按同场景的安全/不安全对比对组织,覆盖多种危害类别。对最先进视觉-语言模型(VLM)的基准测试揭示了指令不敏感的判定:模型在给定场景下不成比例地同时批准两条指令;在主要模型中,平均对准确率仅为24.1%。我们的系统性理由审计定位出主要失效模式:模型未能绑定区分安全与不安全组合的指令相关线索。作为后训练案例研究,判定对数几率监督(VLOS)这一轻量级判定级目标在开放权重骨干上显著提升性能。综上,我们的潜在情境风险任务表述、扎根标准的对比基准构建、对级与理由级失效诊断,以及由基准支持的判定校准,使GuardianBench成为暴露和改进潜在情境风险下指令-场景组合安全推理的受控评估套件。
