论文

Agentic CLEAR:自动对 LLM 代理进行多级评估

Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents

模型评测评测方法与指标

摘要

代理系统变得越来越强大:代理定义策略、采取行动并与不同的环境交互。这种自主权给监督和评估代理行为带来了严峻的挑战。当前的大多数工具都是有限的,侧重于具有基本评估功能的可观察性,或者强加无法适应新领域的静态、手工制作的错误分类法。为了解决这一差距,我们推出了 Agentic CLEAR,这是一个自动、动态且易于使用的评估框架。它在三个粒度级别上生成对代理行为的文本洞察:系统、跟踪和节点。 Agentic CLEAR 在可观察层之上运行,可实现无缝集成,并具有直观的 UI,使代理评估变得易于访问。在我们对四个基准、七个代理设置和数以万计的 LLM 调用进行的实验中,我们表明 Agentic CLEAR 可以产生高质量、数据驱动的、富有洞察力的反馈。我们的分析显示与人工注释的错误有很强的一致性,并且能够预测任务成功率。