论文

评估可复制数据工程的本地语言模型代理:移动工作流程的实证软件工程研究

Evaluating Local Language Model Agents for Reproducible Data Engineering: An Empirical Software Engineering Study of Mobility Workflows

智能体系统模型优化应用与实践Agent任务评测量化编程

摘要

背景:大型语言模型(LLM)代理越来越多地用作软件和数据工程助手,但有关本地可部署的开放权重代理的证据仍然有限。现有的评估通常强调文本响应或孤立的代码生成,而不是完整工程工件的有效性。目标:我们评估本地 LLM 代理是否可以生成正确且可重复的数据工程工件,量化闭环工作空间条件的影响,并检查模型规模、架构、量化、运行时、工具使用和故障方面的权衡。方法:我们引入了十五个移动工作流任务的基准,涵盖数据发现、连接器、传输馈送处理、语义丰富、特征工程、验证、可视化和报告。确定性检查器评估生成的脚本、表格、结构化文件、图形和报告。在一次性和闭环条件下评估 10 种本地配置,每个模型、模式和任务重复 5 次,在消费级 GPU 上进行 1,500 次得分尝试。 结果:在参数超过 20 亿的模型中,工作空间条件比一次性生成提高了 26.7-52.0 个百分点的通过率。最强的配置达到了 85.3% 的工件级成功率,量化的 90 亿参数模型达到了 69.3%,内存占用约为 6.5 GB。当中间工件暴露出代理可以检查和修复的错误时,收益最大。结论:本地开放权重代理可以支持软件稠密型数据工程工作的有意义的子集,但可靠性取决于模型功能、任务可验证性和确定性验证。该基准提供了一种可重复的方法,用于在工程工作流程中采用之前评估完整的代理配置。