论文

评估 AutoML 流水线中 AI 智能体决策与结果的框架

A Framework for Assessing AI Agent Decisions and Outcomes in AutoML Pipelines

智能体系统Agent任务评测

摘要

基于智能体的 AutoML 系统依赖大语言模型在数据处理、模型选择与评估中做出复杂的多阶段决策。然而,现有评估实践仍以结果为中心,主要关注最终任务表现。通过回顾既往工作,我们发现所调研的 Agentic AutoML 系统均未报告结构化的、面向事后评估中间决策质量的决策级指标。针对这一局限,我们提出评估智能体(EA),在不干扰 AutoML 智能体执行的情况下进行决策中心的评估。EA 被设计为观察者,沿四个维度评估中间决策:决策有效性、推理一致性、准确率之外的模型质量风险,以及反事实决策影响。在四项概念验证实验中,我们证明 EA 能够:(i) 以 0.919 的 F1 分数检测错误决策;(ii) 独立于最终结果识别推理不一致;(iii) 将下游性能变化归因于智能体决策,揭示最终指标从 -4.9% 到 +8.3% 的影响。这些结果说明,决策中心的评估能暴露仅看结果指标无法发现的失效模式。我们的工作将 Agentic AutoML 系统的评估从基于结果的视角重构为审计智能体决策的视角,为可靠、可解释、可治理的自主 ML 系统奠定基础。