开源项目
skills-benchmarks:技能文档效果基准
langchain-ai/skills-benchmarks
概述
skills-benchmarks是langchain-ai发布的评测工程,测量技能文档的设计方式如何影响Claude Code对推荐模式的遵循程度,面向研究与设计Agent技能的团队。仓库创建于1月24日,采用MIT许可,提供Docker化任务、验证脚本与pytest运行命令,默认测试模型为Claude Sonnet 4.6并可用环境变量覆盖。技能文档写得是否有效从此可以量化对比。