论文
AgentLens:生产评估的轨迹评审用于编码智能体评估
AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
摘要
我们提出AgentLens:一个生产评估的交互式编码智能体基准。多数代码智能体基准把一次运行压缩为单个比特——任务是否通过?——但实际使用这些智能体的人经历的是整个轨迹:智能体如何遵循指令、使用工具、验证自身工作、从错误中恢复、以及途中如何沟通。AgentLens评估整个轨迹:把形式验证(存在客观检查处)与LLM撰写的轨迹评审及并排比较配对——使每次运行产出“分数为何如此”的可读解释。这让AgentLens不止用于排名模型:我们用它诊断模型行为、比较自家智能体的前后版本、并在夜间评估管线中捕捉产品回归。基准已开源。