论文

BeSafe-Bench:揭示功能环境中情境化智能体的行为安全风险

BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments

智能体系统Agent任务评测

摘要

大型多模态模型(LMM)的快速演化使智能体能够执行复杂的数字与物理任务,但它们作为自主决策者的部署引入了显著的非故意行为安全风险。然而,综合安全基准的缺失仍是主要瓶颈,因为现有评估依赖低保真环境、模拟 API 或范围狭窄的任务。为填补这一空白,我们提出 BeSafe-Bench(BSB),一个揭示功能环境中情境化智能体行为安全风险的基准,覆盖四个代表性领域:Web、Mobile、具身 VLM 与具身 VLA。利用功能环境,我们通过为任务增加九类安全关键风险构建多样的指令空间,并采用规则检查与 LLM-as-a-judge 推理相结合的混合评估框架来评估真实环境影响。对13个流行智能体的评估揭示出一个令人担忧的趋势:即使表现最好的智能体,在完全遵守安全约束的同时完成的任务也少于40%,且强劲的任务表现常常伴随严重的安全违规。这些发现强调在真实环境部署 Agentic 系统之前亟需改进安全对齐。

BeSafe-Bench:揭示功能环境中情境化智能体的行为安全风险
图1:BeSafe-Bench 概览。BeSafe-Bench 通过将初始任务与预定义的安全风险类型和因素相结合,生成安全关键任务数据集。通过智能体与功能环境之间的多轮动态交互,记录环境状态与智能体轨迹。这些数据随后经由混合评估框架处理,以评估任务完成率与安全覆盖率。