开源项目

PawBench:agentscope-ai开源的模型与Harness联合评测系统

agentscope-ai/PawBench

智能体系统Agent HarnessAgent任务评测

概述

PawBench是agentscope-ai组织新建立的评测仓库,定位为可运行的模型与Harness联合评测系统:把被测模型与评测框架作为整体运行和打分,而非只测模型本身。这种联合评测能暴露Harness实现与模型行为之间的匹配问题,适合需要自建Agent评测流水线的团队参考。归档记录还说明,后期补录的评测结果不改变该项目的事件归档日期。本次公开材料未披露具体评测任务与指标。