论文
Glite ARF:使用并行 LLM 编码智能体 验证者驱动的研究
Glite ARF: Verifier-Driven Research with Parallel LLM Coding Agents
摘要
LLM 编码智能体 通过直接委托实验来自动化实证研究很诱人,但天真的委托不能扩展到大型项目:低速率的指令失误会复合成破碎的、不可复制的人工制品。为了解决这个问题,我们提出了 Glite ARF,这是一个开源 Python 框架,用于在研究存储库上并行运行多个 LLM 编码智能体,而不会牺牲可重复性或可审计性。该框架定义了一个三角色堆栈:人类研究人员选择要测试的假设,编码智能体(Claude Code,Codex CLI)在固定结构下实现各个任务,确定性 Python 验证器脚本强制任务隔离、已完成工作的不变性、修正覆盖和物化项目概述。我们称之为验证者驱动的研究:研究过程的规则存在于代码中,一旦违反,就会大声失败,而不是仅仅要求代理遵循的散文。使用 Glite ARF,我们开发了 BEA 2026 词汇难度共享任务的提交,在所有三种目标语言(西班牙语、德语、普通话)的封闭轨道中排名第一,在开放轨道中排名第二,并将官方基线 RMSE 降低了 29.9%(封闭)和 35.9%(开放)。该活动包括跨 129 个功能集的 273 个跟踪任务(146 次实验运行),由一台笔记本电脑协调运行的多达 12 个并行代理(其中一些 模型训练 在租用的 A100 上),LLM API 支出约为 450 美元(第三方总成本 498 美元),结构化的每折叠出处让我们能够捕获并剥离四个目标泄漏的功能集,纠正令人难以置信的 0.609 RMSE 至 0.802。在三个领域的三个活动中,该框架的结构机制仅增加了大约 1% 的挂钟时间。本文附带框架和公共演示项目。