论文
ClawsBench:在模拟工作区中评估LLM生产力智能体的能力与安全性
ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces
摘要
大语言模型 (LLM) 代理越来越多地被部署来自动化生产力任务(例如电子邮件、日程安排、文档管理),但由于潜在的不可逆转的变化,在实时服务上评估它们是有风险的。现有的基准测试依赖于简化的环境,无法捕获真实的、有状态的多服务工作流程。我们推出了 ClawsBench,这是一个在现实生产力环境中评估和改进 LLM 代理的基准。它包括五个高保真模拟服务(Gmail、Slack、Google Calendar、Google Docs、Google Drive),具有完整的状态管理和确定性快照/恢复,以及涵盖单服务、跨服务和安全关键场景的 44 个结构化任务。我们将代理脚手架分解为两个独立的杠杆(通过渐进式披露注入 API 知识的领域技能,以及协调跨服务行为的元提示),并改变两者以衡量其单独和组合的效果。跨越 6 个模型、4 个智能体框架和 33 种条件的实验表明,在完整的脚手架下,智能体的任务成功率为 39-64%,但表现出的不安全行动率为 7-33%。在 OpenClaw 上,排名前五的模型在任务成功率上落在 10 个百分点的范围内 (53-63%),不安全操作率从 7% 到 23%,并且两个指标之间的排序不一致。我们确定了八种反复出现的不安全行为模式,包括多步骤沙箱升级和静默合约修改。
