开源项目

skill-evaluator:增加多模型交叉评审与执行路由

sunxingboo/skill-evaluator

模型评测智能体系统Agent HarnessAgent Skills基准与评测资源评测方法与指标

概述

skill-evaluator 是用于检查Agent Skill质量的评估工具,面向需要维护技能库和比较指令质量的开发者。 实现按八个维度评分并汇总等级;多个模型独立打分后交叉举证,主模型仲裁并记录共识度。执行时根据模型是否原生支持工具选择原生、脚本或混合路径,异常时降级。 单模型分数存在偏差,交叉共识也不等同于实际任务效果。第三方模型路径需要千帆API,评估结果应结合技能的真实执行回归。