技术实践
Anthropic 总结 AI Agent 评测方法体系与落地路径
概述
这是Anthropic工程团队基于内部实践与客户协作总结的Agent评测方法论,聚焦开发阶段的自动化评测。核心论点:Agent的多轮、调工具、改状态特性使单轮评测失效,缺乏评测的团队会陷入被动修复循环。文章统一了任务、grader、transcript、outcome等术语,设计方法包括:grader分代码型、模型型与人工型三类;评测分能力型(低通过率、供爬坡)与回归型(接近全过、防退化),达标的能力评测可转为回归套件;对非确定性用pass@k与pass^k区分“至少一次成功”与“多次全成功”两类产品需求。按Agent类型给出做法:编码Agent以单元测试等确定性grader为主;对话Agent常需第二个LLM模拟用户并按终态与量表评分;研究型Agent组合groundedness、覆盖度与来源质量校验。路线图强调:从真实失败收集20–50个任务起步、写无歧义任务与参考解、避免单向评测、校准LLM裁判并勤读transcript。文中引Claude Code评测演进及Opus 4.5在CORE-Bench因评分缺陷从42%修正到95%等案例。