论文

谁属于评估组?用于在代理可扩展性平台中管理回归评估集的能力分类驱动管道

Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

模型评测评测方法与指标

摘要

托管代理可扩展性表面的平台团队面临着回归经济学悖论:每个入职客户都会提供适合其领域的评估集,但平台的回归集必须处于受发布节奏限制的硬查询计数上限之下。据我们所知,没有已发布的工业管道解决这个平台端管理问题:现有的评估框架是客户端的,基准压缩工作将基准视为固定池而不是传入集流。我们描述了一种功能分类驱动的管理管道,该管道应用于 Microsoft 365 Copilot 中具有自定义操作的声明式代理。它将代理规范和客户的评估集作为输入,将每个查询投影到平台拥有的功能分类中,并输出每个查询的决策(承认、删除、交换或人工审核),其理念是健康的回归集是捕获功能签名最大扩展的最小查询集(查询一起执行的功能的不同组合)。三个组件对此进行了实例化:分类器通过基于确定性规范的提取和大语言模型 (LLM) 语义推理的混合来生成每个(查询、功能)判决;调用质量 (IQ) 评估者对查询执行每个功能的彻底程度进行评分,因此与现有条目共享签名的新查询仍然可以被认为是更好的测试并取代它;整合器通过基于规则的决策级联,将传入的查询与覆盖率和质量的回归集进行比较,并由仅建议驱逐的保守派管理者支持。该机制与分类法无关,适用于具有类型化能力分类法的任何回归评估集管理问题,包括根据管道表面的证据而演变的分类法。