论文
无云的智能体编码:开放权重LLM在纵向数据准备任务上的评估
Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks
摘要
大语言模型(LLM)与智能体现在是代码开发的常用工具,但数据通常被送往第三方云端模型。它们在使用个人数据的研究中的采用受治理要求制约——通常禁止向外部服务传输数据。可本地部署的开放权重模型提供了替代:敏感数据永不离开本地环境。我们引入一个开源框架,评估开放权重LLM驱动的AI智能体在纵向人口研究最持久的瓶颈之一——数据准备——上的效力。框架含:精选的真值数据集(为英国队列研究六个sweep准备数据的清洗脚本)、涵盖类别统一与多波合并等任务的任务定义、以及评估LLM产出R代码与输出数据的自动化例程。我们在消费级部署谱系上基准测试LLM在20个数据准备任务(创建102个变量)上的效力。当前最先进的31–35B参数模型几乎饱和我们的基准(平均任务完成率最高87.9%)。跑在消费级硬件上的开放权重LLM的表现,显示了在治理受限的研究环境中走向AI辅助数据准备的可行路径。框架公开于https://github.com/UCL-ARC/RRBench。