论文

LPS-Bench:在良性与对抗场景下评测计算机使用智能体长程规划的安全意识

LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios

智能体系统智能体互操作协议Agent任务评测MCP长程任务评测

摘要

与真实计算机系统交互的计算机使用智能体(Computer-Use Agents,CUA)能够执行自动化任务,但面临关键安全风险。模糊指令可能触发有害操作,对抗性用户可以操纵工具执行以达成恶意目标。现有基准大多聚焦短程或基于GUI的任务,评估执行时错误,却忽视预见规划时风险的能力。为填补这一空白,我们提出LPS-Bench,一个评测基于MCP的CUA在长程任务下规划时安全意识的基准,涵盖7个任务域、9种风险类型共65个场景的良性与对抗交互。我们引入多智能体自动化流水线以实现可扩展的数据生成,并采用LLM-as-a-judge评估协议,通过规划轨迹评估安全意识。实验揭示了现有CUA在维持安全行为能力上的严重不足。我们进一步分析风险并提出缓解策略,以提升基于MCP的CUA系统的长程规划安全性。我们已开源代码:https://github.com/tychenn/LPS-Bench。

LPS-Bench:在良性与对抗场景下评测计算机使用智能体长程规划的安全意识
图3:LPS-Bench 概览。该框架展示了多智能体测试用例生成以及随后通过 LLM-as-a-judge 进行自动化评估的流程。附录 B 中给出了带有完整轨迹示例的其他测试用例,以作进一步说明。