论文
AlphaLab:前沿 LLM 跨优化领域的自主多智能体研究
AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs
摘要
我们推出了 AlphaLab,这是一种自主研究工具,它利用前沿的 LLM 代理功能来自动化定量、计算密集型领域的整个实验周期。仅给定一个数据集和一个自然语言目标,AlphaLab 在没有人工干预的情况下经历三个阶段:(1)适应领域并探索数据,编写分析代码并生成研究报告; (2)构建并对抗性验证自己的评估框架; (3) 它通过 Strategist/Worker 循环运行大规模 GPU 实验,在持久的 playbook 中积累领域知识,该 playbook 充当在线提示优化的一种形式。所有特定于域的行为都被纳入模型本身生成的适配器中,因此同一管道无需修改即可处理性质不同的任务。我们在三个领域使用两个前沿 LLM(GPT-5.2 和 Claude Opus 4.6)评估 AlphaLab:CUDA 内核优化,它编写的 GPU 内核平均运行速度比 torch.compile 快 4.4 倍(最高 91 倍); LLM 预训练,与使用相同模型的单次基线相比,整个系统的验证损失降低了 22%;和交通预测,在研究和实施文献中已发布的模型系列后,它比标准基线高出 23-25%。这两个模型在每个领域都发现了性质不同的解决方案(两者都没有统一主导),这表明多模型活动提供了互补的搜索覆盖范围。我们还在附录中报告了金融时间序列预测的结果,并在 https://brendanhogan.github.io/alphalab-paper/ 上发布了所有代码。