论文

DS-Lighting:让数据科学自动化中的智能体Harness显式化

DS-Lighting: Making Agent Harnesses Explicit for Data-Science Automation

智能体系统AI 基础设施Agent HarnessSandboxAgent Sandbox

摘要

大语言模型 (LLM) 代理已显示出实现数据科学工作流程自动化的前景,但其端到端性能主要取决于代表任务、管理执行状态、约束输出工件和提供评估反馈的代理工具。现有的数据科学代理通常会隐式使用这种工具,导致结果难以在异构任务中重现、比较和归因。我们推出 DS-Lighting,这是一个统一的Harness工具包,可以使Harness设计明确用于数据科学自动化。 DS-Lighting 将Harness分解为四个可重用层:数据、工作流、执行和评估,并将不同的代理表示为支持预定义管道和自适应搜索的可执行操作程序。我们进一步将多个开源数据科学基准集成到 MLE-Bench 风格的任务格式中,从而在共享任务接口、沙盒运行时和指标协议下实现受控比较。跨代理、Harness、模型和消融的实验表明,显式Harness设计提高了可重复性、可比性和可靠性,同时减少了端到端数据科学工作流程中可避免的系统级故障。我们的代码可在 https://github.com/usail-hkust/dslighting 获取

DS-Lighting:让数据科学自动化中的智能体Harness显式化:论文配图
图1 现有数据科学剂与DS-光线( 我们) 。对比促使智能体Harness导向的设计:现有智能体将任务数据、执行和评价纠缠在一起,而DS-Lighting将它们与地面数据脱钩,管理执行,并使产出与计量标准保持一致。