论文
SkillCoach:评估与增强智能体技能使用的自进化量规
SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use
摘要
技能正成为LLM智能体的可复用操作层——编码SOP、领域规则、工具工作流、脚本与验证例程。在现实技能库中——重叠技能使可靠技能使用变得困难。最终验证器成功对评估与训练都太粗——因为智能体可能通过试错通过任务——同时选择干扰技能、跳过必需步骤、错误组合工作流或遗漏最终检查。我们介绍SkillCoach——评估与增强智能体技能使用的自演化量规框架。SkillCoach从真实rollout导出技能锚定的过程量规——沿四个维度评估轨迹:技能选择、技能遵循、技能组合与技能锚定的反思。它将外部验证器保留为独立的结果信号——使过程质量得以与偶然的任务成功区分。演化出的量规进一步作为过程监督用于选择高质量训练轨迹。实验表明演化量规大幅提升评估质量——暴露被最终准确率隐藏的失败——并提供比仅结果过滤更强的监督信号以增强智能体技能使用。
