论文

评估企业分析代理:端到端、可追溯的方法

Evaluating Enterprise Analytics Agents: An End-to-End, Trace-Backed Methodology

智能体系统Agent任务评测

摘要

企业分析代理不仅仅是文本到 SQL 的系统。他们解释业务意图并选择指标定义。他们选择数据源、执行工具、检查结果并生成自然语言答案。这些答案可能会影响运营、财务或执行决策。对最终答案进行评分隐藏了这些代理失败的地方。看似合理的答案可能使用错误的事实来源。它可以跳过所需的分解,在没有支持的情况下声明因果关系,或者在重复运行中更改其表解释。我们为分析代理提供了一种端到端的评估方法。该方法对三个类别的代理行为进行评分:语义理解、执行质量和可靠性。评分使用带有人工编写的标准答案、重复运行和运行时跟踪的问题库。每次运行首先通过运行有效性检查,然后接收分层的、弃权意识的分数,这些分数提供给决策框架而不是发布门。我们在大型在线市场的受控内部分析代理上实例化了该方法。该案例研究使用 50 个分析问题、两个匿名模型配置以及每个配置的 3 次随机重复,产生 300 条跟踪。更高功能的配置将早期拒绝率从 73% 降低到 0%,并将实际数据答案从 21% 提高到 73%。然而,它还在 16% 的运行中耗尽了工具轮预算。 77% 的跟踪超出了模式探索预算。它改变了 50 个问题中 41 个问题的表格解释。在具有结构化标准答案的金融问题上,源表的使用和升级得到了改善,但两种配置中的规范分解仍然很弱。这些结果说明了为什么对分析代理的信任需要端到端、跟踪支持的评估,而不仅仅是 SQL 正确性或最终答案质量。