论文
DataFlow-Harness:用于构建可编辑 LLM 数据管道的基于真实平台状态的代码 Agent 平台
DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
摘要
大语言模型 (LLM) 越来越多地用于自动化数据处理工作流程,但 编码智能体 通常生成的脚本不会自动具体化为持久的、可编辑的平台工件。我们将这种断开称为 \textit{NL2Pipeline 间隙}。为了桥接它,我们引入了 \textsc{DataFlow-Harness},这是一个引导 LLM 代理通过类型化、增量突变而不是自由格式脚本构建平台本机有向无环图(DAG)的平台。该平台结合了用于程序指导的 \textsc{DataFlow-Skills}、公开实时操作员注册表和当前管道状态的模型上下文协议 (MCP) 层,以及将对话式创作与可视化 DAG 编辑器同步的 \textsc{DataFlow-WebUI}。在 12 任务数据工程基准测试中,\textsc{DataFlow-Harness} 实现了 93.3% 的观察到的端到端通过率。相对于 Vanilla Claude Code,测量的货币成本降低了 72.5%,生成延迟降低了 49.9%;其观察到的通过率与上下文感知 Claude 代码基线相差不到 0.9 个百分点,而成本却降低了 42.8%。每个任务的分析表明,当构建依赖于隐含的程序知识时,技能最有用。这些结果表明,实时平台基础可以产生持久的、可编辑的工作流程工件,其观察到的可靠性接近于脚本生成基线,并且具有较低的测量构建成本和延迟。