论文
一次重写就足够了:生产技能描述优化的经验教训
A Single Rewrite Suffices: Empirical Lessons from Production Skill Description Optimization
摘要
企业人工智能代理通过将查询与自然语言技能描述进行匹配,将用户查询路由到专业技能。当两个技能共享重叠描述时,路由 LLM 会错误路由查询,我们将这种故障称为技能冲突。随着代理扩展到数十种技能,手动调整描述以保持路由准确性成为一个重要的工程瓶颈。我们在生产企业群聊代理上部署了自动描述优化管道(9项技能,372个回归案例)。该管道生成平均 79.2% F1 的描述,与 79.4% F1 的手动调整描述相匹配(每个技能的平均差异为 -0.20%,在 0.78% 多种子本底噪声范围内),同时将每个技能的工程工作量从 120 分钟减少到 3.8 分钟(加速了 32 倍)。然后我们检查哪些管道组件实际驱动了这场比赛。对生产系统和 ToolBench(16k 工具)的系统消融表明,使用任何可用的假阳性和假阴性案例进行单个 LLM 重写即可捕获大部分可用的改进。我们测试的其他设计选择(迭代预算、反馈信号组成、混淆对的双重编辑和训练集大小)对最终 F1 的影响均小于 0.5%。描述优化可以解决由重叠描述引起的技能冲突,但无法解决两个技能的预期范围真正重叠的情况。我们确定了一个诊断(一个大的训练验证 F1 差距),该诊断将后一种情况标记为架构而非文本级干预。