论文

EvoDS:具有技能学习与上下文管理的自演化自主数据科学智能体

EvoDS: Self-Evolving Autonomous Data Science Agent with Skill Learning and Context Management

智能体系统模型训练上下文与知识强化学习上下文工程Agent HarnessAgent SkillsAgentic RL

摘要

大型语言模型(LLM)代理的最新进展使自动化数据科学取得了有希望的进展。然而,现有方法仍然从根本上受到静态操作集和缺乏有原则的长期上下文管理的限制,阻碍了它们跨任务积累可重用经验以及在多阶段、迭代数据科学管道中可靠运行的能力。为了应对这些挑战,我们引入了 EvoDS,这是一种自我进化的自主数据科学代理,它可以通过代理强化学习来学习扩展其技能并自适应地管理长期环境。具体来说,EvoDS引入了两个关键策略:(1)自主技能获取(ASA)机制,使代理能够合成、验证和重用可执行技能; (2)自适应上下文压缩(ACC)策略,它将上下文管理视为学习控制问题而不是被动截断。这些策略在两阶段多代理训练方案中精心策划,使 EvoDS 能够随着时间的推移自主改进。理论上,我们证明EvoDS的分层设计减少了工具选择错误,其优化目标符合信息瓶颈原则,确保了上下文的高效使用。根据经验,EvoDS 在四个不同的基准测试中平均比最先进的开源数据科学代理高出 28.9%,同时消除了令牌外故障。我们的代码和数据可在 https://github.com/usail-hkust/EvoDS 获取。

EvoDS:具有技能学习与上下文管理的自演化自主数据科学智能体:论文配图
图 1.EvoDS 概述。 (a) EvoDS 采用分层多代理架构,为数据科学任务提供自主技能获取和自适应上下文压缩。 (b) 代理通过 SFT 和代理 RL 进行训练,以联合优化任务执行、技能获取和上下文管理。