论文
LongDS-Bench:论长期代理数据分析的失败
LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis
摘要
现实世界的数据分析本质上是迭代的,但现有的基准大多评估孤立的或短期的交互任务,使得代理在长期范围内跟踪不断变化的分析环境的能力未经测试。我们引入了 LongDS,这是一个长期、多轮数据分析的基准,智能体必须维护、更新、恢复和组合不断变化的分析状态。 LongDS 包含 68 个由真实 Kaggle 笔记本构建的任务,涵盖地球科学、商业和教育等六个领域的 2,225 个回合。任务是围绕状态演化模式(例如反事实扰动、回滚、多状态组合)设计的,平均依赖跨度为 11.3 轮。通过评估五个最先进的模型,我们发现最好的模型平均准确率仅为 48.45%,从早转弯到晚转弯性能下降了近 47 个百分点,长视野误差占失败的 52%--69%。进一步的分析表明,额外的代理步骤并不一定会提高性能,这表明关键瓶颈是维持正确的分析状态而不是增加交互预算。我们发布 LongDS 来支持可靠的长期代理数据分析研究。代码和数据发布于https://github.com/zjunlp/DataMind。