开源项目

skills-benchmarks:技能文档效果基准

langchain-ai/skills-benchmarks

智能体系统Agent任务评测Agent Skills

概述

skills-benchmarks是langchain-ai发布的评测工程,测量技能文档的设计方式如何影响Claude Code对推荐模式的遵循程度,面向研究与设计Agent技能的团队。仓库创建于1月24日,采用MIT许可,提供Docker化任务、验证脚本与pytest运行命令,默认测试模型为Claude Sonnet 4.6并可用环境变量覆盖。技能文档写得是否有效从此可以量化对比。