论文
OpenSkillRisk:使用现实世界中存在风险的第三方技能时对代理安全进行基准测试
OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills
摘要
基于 LLM 的代理利用第三方技能来扩展其在开放世界场景中的功能。然而,第三方技能可能会引入额外的安全漏洞,因为看似无害的技能可能包含仅在实际执行过程中才会出现的潜在安全风险。在这项工作中,我们对当前代理系统识别和避免此类风险的程度进行了系统调查。为了支持定量和定性评估,我们构建了 OpenSkillRisk,这是一个专门的安全基准,包含从公共技能市场收集的 263 种有风险的技能。我们根据威胁类型将这些技能分为七类,并将每种技能与标准化用户任务和相应的沙箱配对以进行受控评估。与以往的基准测试不同,OpenSkillRisk不仅涵盖了更现实、更多样化的不安全场景,而且还提供了细粒度的分析来诊断代理在此类场景中的行为模式。我们对三种主流 CLI 代理框架和 13 种最先进的 LLM 进行了全面的实验。实验结果表明,没有经过测试的系统能够可靠地处理有风险的技能:即使是最安全的配置,在大约 17% 的情况下仍然会执行不安全的操作。对于当前的代理系统来说,上下文相关的风险和系统级风险尤其难以避免。我们的行为分析揭示了三种反复出现的失败模式:代理可能无法识别风险,识别风险但未能在采取行动之前进行干预,或者遵循超出用户预期范围的技能指令。这些发现强调需要改进 LLM 中的风险推理和代理框架中的执行控制。