论文

大语言模型代理中的技能可用性和呈现粒度:受控技能基准研究

Skill Availability and Presentation Granularity in Large-Language-Model Agents: A Controlled SkillsBench Study

智能体系统Agent任务评测Agent Skills

摘要

技能文档在推理时向大语言模型代理提供程序知识。本文研究受控技能知识的呈现粒度是否会改变下游任务的成功。该实验使用固定的 SkillsBench 版本、由官方预言机运行验证的 30 个任务域平衡子集、两个支持推理的模型配置、六个技能条件以及每个任务条件模型单元的五个试验。技能可用性是最清晰的经验信号。相对于无技能,技能条件将 GPT-5.5 的任务平均通过率提高 26.7 至 36.0 个百分点,将 DeepSeek V4-Flash 提高 18.0 至 26.0 个百分点。最终数据包含 1,800 行,每个模型 900 行。任务是推理单元。在估计超过 30 个任务的配对对比之前,每个任务条件模型单元内会聚合 5 次试验。主要表现对比较小且不确定。 GPT-5.5 的低抽象指导与 DeepSeek V4-Flash 的高抽象指导相差 +0.7 个百分点,而 DeepSeek V4-Flash 的低抽象指导与高抽象指导相差 -6.7 个百分点,两者 95% 的引导置信区间均为零。在中等抽象指南中添加一个有效示例与无示例变体的差异分别为 +0.7 和 +1.3 个百分点。平均奖励稳健性检查保留了相同的实质性结论。在这个受控子集中,技能可用性比没有技能与更高的成功相关,而测试的呈现粒度变化会产生较小的、不确定的且依赖于模型的效果。