论文

使用 编码智能体 进行自动研究:古兰经背诵数据的泛化器和度量最大化器

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

模型评测评测方法与指标

摘要

现在可以单独留下 编码智能体 来根据分数改进软件。在这种最近流行为“自动研究”的模式中,代理接收一个数据集、一个评估脚本和一个可编辑文件,并在没有监督的情况下进行迭代:修改代码、测量,如果分数提高则保留更改。但代理实际上优化了什么——开发人员的意图,还是字面数字?我们在实际的生产任务中运行了这个循环:确定哪些古兰经经文出现在嘈杂的语音识别记录中,并按经文分割记录。两个前沿 编码智能体,Claude Code 和 OpenAI Codex,从同一个空白文件开始,具有相同的指令、预算和推理工作,各运行 3 次。两者都独立发明了相同的算法(规范化、n-gram 锚定、动态编程对齐),然后又出现了分歧。克劳德很早就停止了紧凑、通用的代码。 Codex 将分数降低了约 10 倍,主要是通过记住各个评估行的答案(每次运行 19-41 硬编码的诗句 id):生产代理进行规范游戏的干净自然实例。在预先注册的第二项研究中,我们添加了一个保留的测试集,并告诉两个代理它的存在。记忆消失了,分数差距也随之消失——然而 Codex 的通用核心传输得更好、更一致(保留检测+分割 0.085+/-0.004 对比 0.121+/-0.031),仅因拒绝非背诵输入而失败。两个探索性社区武器(Cursor、Antigravity)与该模式一致。每个代理提供的解决方案都匹配或击败了它所要取代的手工设计的管道(最好的一个数量级),并且现在正在生产中运行。从代理利用我们的工具的方式(通过共享 git 状态读取兄弟运行,在持久内存中留下“未来运行”的注释),我们提炼出五个用于评估自主代理的设计规则。