论文

SemPiper:机器学习管道中语义运算符的交互式代码合成

SemPiper: Interactive Code Synthesis for Semantic Operators in Machine Learning Pipelines

摘要

机器学习 (ML) 管道需要大量的数据准备、特征工程以及跨异构源的集成,这使得它们的开发变得乏味且容易出错。虽然 大语言模型 (LLM) 最近显示出协助编程任务的希望,但基于聊天的界面对管道行为的控制有限,并且通常生成难以优化或集成到生产系统中的代码。我们演示了 SemPipes,这是一种新颖的编程模型,它通过声明性、LLM 支持的语义数据运算符扩展了 ML 管道。 SemPipes 允许开发人员为以数据为中心的操作指定高级自然语言指令,同时将这些运算符与标准数据科学库中的任意 Python 代码无缝组合。对于语义运算符,它在管道训练时综合专门的实现,以数据集特征和管道上下文为条件,从而实现 LLM 功能的灵活但受控的集成。我们通过 SemPiper 演示了 SemPipes,SemPiper 是一个交互式界面,可以可视化管道的计算图、合成运算符实现以及进化搜索过程产生的优化轨迹。与会者可以探索三种端到端场景、修改管道、检查生成的代码,并观察语义运算符是如何合成和迭代优化的。该演示重点介绍了声明性语义运算符如何将 LLM 可控、可优化且实用地集成到 ML 管道开发中。