论文

用AgentFuel为时间序列数据分析智能体生成富有表达力且可定制的评测

Generating Expressive and Customizable Evals for Timeseries Data Analysis Agents with AgentFuel

智能体系统Agent任务评测

摘要

在众多领域(如物联网、可观测性、电信、网络安全)中,让用户“与数据对话”以提取洞见的对话式数据分析智能体正在兴起。此类数据分析智能体运行在时间序列数据模型之上,例如传感器测量数据,或产品分析中监测用户点击与行为的事件。我们在领域特定数据与查询类型上评测了6个流行的数据分析智能体(含开源与专有),发现它们在有状态与事件特定查询上表现失败。我们观察到现有评测存在两个关键的表达力缺口:领域定制数据集与领域特定查询类型。为让这些领域的从业者能为时间序列数据智能体生成定制化且富有表达力的评测,我们提出AgentFuel。AgentFuel帮助领域专家快速创建定制评测以执行端到端功能测试。我们展示AgentFuel的基准暴露了现有数据智能体框架的关键改进方向。我们还提供了初步证据表明,使用AgentFuel可以改善智能体性能(例如结合GEPA)。AgentFuel基准已发布于 https://huggingface.co/datasets/RockfishData/TimeSeriesAgentEvals。