论文

从看似合理到真正可用:客户反馈分类树的Agent Harness评测

From Plausible Hierarchies to Useful Taxonomies: Evaluating Agentic Harnesses on Customer Feedback

模型评测上下文与知识智能体系统本体Agent Harness评测方法与指标

摘要

分类法是人工智能系统组织证据、聚合模式并回答大型文档集合问题的符号表示。根据客户反馈,类别树决定如何计算和路由每条记录、发现哪些问题以及哪个团队拥有这些问题。现在,Agentic 工具可以轻松生成看似合理的层次结构,并且现在可以使用通用的、单独范围的检查来检查此类树:每个名称都符合其描述,位于正确的父级下,并且与其兄弟姐妹保持不同。我们提出一个更具操作性的问题:生成的层次结构何时真正可用作生产分类法?我们在两个专有反馈语料库(1,940 条和 5,000 条记录)上构建了六种分类法:对于每个语料库,一个生产参考以及在相同输入下对同一工具进行两次重复运行。所有六个都通过了所有通用命名和结构检查,更深入的产品覆盖范围检查甚至更喜欢生成的树。然而,在每棵生成的树中,至少 97.7% 的叶子名称仅重述了祖先的名称(参考文献中分别为 13.9% 和 2.9%),并且在一棵树中,四分之三的记录属于多个顶级类别。我们引入了两个全树度量家族:结构判别器测试树的形状是从数据中学习的还是由其生成器强加的;团队可划分性测试分支机构是否将反馈划分为团队可以拥有的组。树的通用检查率同样正确,在跨分支泄漏方面相差 27 个百分点,并且两者中只有一个胜过随机拆分。表面合理性不足以衡量分类质量:评估必须测量整个树以及每个节点。