论文
BeSafe-Bench:揭示功能环境中情境化智能体的行为安全风险
BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments
摘要
大型多模态模型(LMM)的快速演化使智能体能够执行复杂的数字与物理任务,但它们作为自主决策者的部署引入了显著的非故意行为安全风险。然而,综合安全基准的缺失仍是主要瓶颈,因为现有评估依赖低保真环境、模拟 API 或范围狭窄的任务。为填补这一空白,我们提出 BeSafe-Bench(BSB),一个揭示功能环境中情境化智能体行为安全风险的基准,覆盖四个代表性领域:Web、Mobile、具身 VLM 与具身 VLA。利用功能环境,我们通过为任务增加九类安全关键风险构建多样的指令空间,并采用规则检查与 LLM-as-a-judge 推理相结合的混合评估框架来评估真实环境影响。对13个流行智能体的评估揭示出一个令人担忧的趋势:即使表现最好的智能体,在完全遵守安全约束的同时完成的任务也少于40%,且强劲的任务表现常常伴随严重的安全违规。这些发现强调在真实环境部署 Agentic 系统之前亟需改进安全对齐。
