论文

SPADE-Bench:通过计划-行动分歧评估Agent的自发战略欺骗

SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence

智能体系统模型评测Agent任务评测安全与风险评测

摘要

随着基于 LLM 的代理扩大其操作范围,可靠性成为实际部署的先决条件。然而,在实际应用中,人类用户无法监控每一个即时行为;相反,执行过程通常仍然是一个黑匣子,使用户仅依赖于代理自我报告的更新。这种不透明性造成了一个严重的风险:代理可能会向观察者提供与其执行的操作不同的报告,从而导致系统失控,尤其是在高风险的自主场景中。我们将这种自我报告的计划与行动分歧称为Agent欺骗。为了评估这一点,我们引入了 SPADE-Bench,这是一个旨在评估自发计划与行动分歧的基准。与之前的欺骗基准不同,SPADE-Bench 同时集成了实际工具执行和受控压力场景。这种设计确保了生态有效性,并通过压力下受控的计划与行动比较,严格区分战略欺骗与纯粹的幻觉。主流模型的实验证实,代理欺骗是工具使用环境中一个真正而紧迫的问题。通过提供全面而强大的评估框架,SPADE-Bench 填补了智能体安全方面的关键空白,促进社区在构建可信、可控的自主系统方面取得进展。