论文

Claw-Eval:实现自主代理的可信评估

Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents

智能体系统Agent任务评测

摘要

大语言模型越来越多地部署为在现实软件环境中执行多步骤工作流程的自主代理。然而,现有的代理基准受到三个关键限制:(1)仅检查最终输出的轨迹不透明分级,(2)未指定的安全性和鲁棒性评估,以及(3)狭窄的模态覆盖范围和交互范例。我们推出了 Claw-Eval,这是一个解决所有三个差距的端到端评估套件。它包含 300 项经过人工验证的任务,涵盖 9 个类别、三个组(一般服务编排、多模态感知和生成以及多轮专业对话)。每个代理操作都通过三个独立的证据通道(执行跟踪、审核日志和环境快照)进行记录,从而能够对 2,159 个细粒度项目进行轨迹感知分级。评分协议评估完成度、安全性和稳健性,报告三项试验的平均分、Pass@k 和 Pass^k,以区分真正的能力和幸运的结果。对 14 个前沿模型的实验表明:(1)轨迹不透明评估在系统上是不可靠的,遗漏了我们的混合管道捕获的 44% 的安全违规和 13% 的鲁棒性故障; (2) 受控错误注入主要降低一致性而不是峰值能力,Pass^3 下降高达 24%,而 Pass@3 保持稳定; (3) 多模态性能差异很大,大多数模型在视频上的性能比在文档或图像上的性能差,并且没有单一模型在所有模态上占主导地位。除了基准测试之外,Claw-Eval 还强调了代理开发的可行方向,揭示了如何构建不仅有能力而且可可靠部署的代理。

Claw-Eval:实现自主代理的可信评估
图 1:Claw-Eval 架构。该框架跨三个时间阶段(设置、执行、判断)和三个空间层(主机、隔离环境、模拟服务)运行。在执行过程中,代理在隔离环境中工作,与工作区文件、模拟服务和系统层工具进行交互。临时防火墙将执行与评分分开:评分器使用三个独立的证据通道(执行跟踪、环境快照和服务器端审核日志),这些通道在执行期间永远不会暴露给代理。