论文
ClawTrack:对现实世界自主代理进行跟踪级评估和改进
ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents
摘要
由于基于 LLM 的代理部署在复杂的多步骤工作流程中,出现了一个关键的评估差距:大多数现有基准仅判断最终结果,无法区分可靠的推理和幸运的成功,也无法将失败归因于特定的流程缺陷,从而阻碍了长期任务的归因。在这项工作中,我们提出了 ClawTrack,这是一种双重评估基准,可同时衡量代理实现的目标(任务得分)以及实现目标的方式(流程得分)。 ClawTrack 包含 8 个领域的 320 项任务以及 25 多个确定性模拟服务。流程评分器沿着四个维度(目标一致性、效率、信息利用和结果验证)对每个推理回合进行评分,以 12,541 个特定任务的评分标准项目为基础。通过对超过 16,000 次试验的 21 个模型进行评估,我们发现:(1) 过程评分有效地将成功和失败归因于特定的推理维度,过滤了对仅结果评估不可见的幸运通过; (2)四个维度互补,结果验证是系统瓶颈; (3) 该框架对于不同法官之间的评估者选择具有鲁棒性 LLM; (4) 基于过程的轨迹过滤在整个模型尺度上产生一致的 后训练 改进。