论文

从生产运行轨迹中挖掘智能体技能

Mining Agent Skills from Production Traces

智能体系统Agent Skills

摘要

记录程序指令的智能体技能越来越多地从执行跟踪中挖掘,而不是手工策划。技能挖掘管道通常使用已知的任务结果或反馈来指导技能构建。在生产中,可能无法获得有关运行是否成功的可靠信息。我们研究执行轨迹的采样、成功或失败信息的访问以及挖掘技能的形式如何影响下游任务绩效。保持技能挖掘流程固定,我们比较了挖掘证据和技能形式的六种组合。挖掘证据分为三个级别:仅成功轨迹、成功和失败及其结果标签,或相同的成功失败组合但不提供结果标签。技能形式有两种类型:有序的工作流程计划,或实体、状态和策略的声明性本体。我们在两个企业基准测试(ThinkingBox-Bench 和 APEX-Agents)上评估挖掘的技能。任务级配对差异分析表明,挖掘证据和技能形式的不同配置的好处取决于企业领域。在 ThinkingBox-Bench 上,配对差异显示工作流程比本体得分高 1.7 个百分点,Goldilocks比仅成功证据类型高 2.4 个百分点,而模拟未获结果标签而学习技能的 Goldilocks blind则差 3.1 个百分点。 APEX-Agents对本体表现出适度的偏好,并且在证据体系之间没有明显的偏好。在每个领域内,与任务结构相关的约束导致所挖掘的技能表现参差不齐。这些发现促使我们根据目标任务的需求定制元技能,而不是采用一刀切的方法。