论文
TimeEvo:时间序列Agent的失败驱动自我进化
TimeEvo: Failure-Driven Self-Evolution of a Time Series Agent
摘要
时间序列Agent通过调用外部工具回答分析问题,而它们携带哪些工具由人在Agent运行前决定。然而,我们识别出这一设定中的两类失败。人类-Agent工具错配:一个由21个专家策划工具组成的库在某些任务上有帮助、在另一些任务上有害,在我们测试的每个骨干下都降低了异常检测准确率。静默伤害:一轮通用的自我修订改变了147个答案却破坏了其中56个,而最终得分变动不到一分。两者源于同一缺口:一个工具是否有用是在运行时逐题决定的,而工具却是预先提供、并以单一平均值评判的。为解决这一问题,我们提出TimeEvo:把Agent诊断出的失败聚类为能力缺口,为每个缺口规划一项测量,合成仅基于证据的工具来填补缺口,并且只通过成对准入门控接纳候选工具库。在十个时间序列问答任务与三个骨干上的实验表明,TimeEvo从空库出发,在所有任务与所有骨干上都提升准确率,而且在便宜模型上长成的库装入更强模型后仍有收益。代码已开源。
