论文
LLM生成的技能能造就更好的AI数据科学家吗:数据科学工作流的组件消融
Do LLM-Generated Skills Make Better AI Data Scientists? A Component Ablation Across Data-Science Workflows
摘要
产品数据科学家常请LLM智能体帮助处理重复执行任务:清洗数据、写SQL、选统计检验、格式化结果。可复用技能文件旨在通过打包任务族的指导来避免从零提示。专家撰写的技能可编码高质量指导,但跨众多数据科学任务族编写与维护它们构成人工瓶颈。我们追问LLM生成的技能是否提供了有用的低策展替代:它们是否比仅任务提示改善表现?我们在四个生命周期阶段测试该问题:数据准备、数据抽取、统计分析与报告——每阶段一个生成技能。我们发现完整生成技能相对无技能提示没有可靠改进。我们随后经消融不同技能组件追问技能的任何部分是否有用。主消融覆盖56任务、九个模型配置与三家供应商——7,560次运行。与仅任务提示相比:完整生成技能与任何消融变体都没有显著改善表现——所有p值至少0.396,变体间总差距仅1.2分。补充的token匹配对照再加1,512次运行,发现完整技能与任务无关的技能格式化内容表现相近。结果告诫不要把每个数据科学工作流配一个LLM生成技能作为默认的单发提示策略。