论文
SkillAxe:通过评估引导的自我完善来提高 LLM 创作的代理技能
SkillAxe: Sharpening LLM-Authored Agent Skills Through Evaluation-Guided Self-Refinement
摘要
技能文档,即指导 大语言模型 (LLM) 代理的结构化自然语言指令,对于现代代理框架至关重要,但 LLM 很难编写实际有效的技能。在 SkillsBench 上,人工编写的技能将通过率提高了 16.2 个百分点,而 LLM 编写的技能没有提供可测量的增益。我们引入 SkillAxe,这是一个完全无监督的框架,使 LLM 能够迭代地诊断和完善自己的技能。 SkillAxe 将技能质量分解为四个可解释的维度(质量影响、触发精度、故障归因指令合规性和解决方案路径覆盖率),生成不需要 真值 标签、测试套件或环境奖励的结构化改进简报。在 SkillsBench 上,SkillAxe 相对于未改进的 LLM 技能,通过率提高了 28%,并缩小了与人类创作技能 47--67% 的差距。我们在 SpreadsheetBench 上验证了该方法作为持续改进引擎的能力,其中 SkillAxe 构建的技能库从过去的代理轨迹中学习,仅使用 22 种技能即可将通过率从 16.0\% 提高到 52.0\%。