论文

智能体式神经架构发现:AIRA-Compose与AIRA-Design

Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design

智能体系统Agent 协作

摘要

面向递归自我改进,我们研究让LLM智能体自主设计超越标准Transformer的基础模型。我们引入双框架方法:AIRA-Compose负责高层架构搜索,AIRA-Design负责低层机制实现。AIRA-Compose使用11个智能体在24小时预算内探索基础计算原语。智能体评估百万参数级候选,并将最优设计外推到350M、1B和3B规模。由此产生两个家族共14种架构:AIRAformers(基于Transformer)与AIRAhybrids(Transformer-Mamba混合)。在1B规模预训练后,它们持续优于Llama 3.2与Composer找到的基线。在下游任务上,AIRAformer-D与AIRAhybrid-D分别比Llama 3.2提升准确率2.4%和3.8%。此外,AIRA-Compose发现了具有高效扩展前沿的模型:AIRAformer-C的扩展速度比Llama 3.2和Composer最佳Transformer分别快54%和71%,而AIRAhybrid-C的扩展规模超过Nemotron-2达23%、超过Composer最佳混合模型达37%。AIRA-Design让20个智能体编写面向长程依赖的新型注意力机制以及高性能训练脚本。在Long Range Arena基准上,智能体设计的架构在文档匹配与文本分类上分别达到与人类最先进水平相差不超过2.3%和2.6%的成绩。在Autoresearch基准上,Greedy Opus 4.5在固定时间预算下取得0.968的验证bits-per-byte,超过了已发表的最低值。这两个框架共同表明,AI智能体能够自主发现媲美乃至超越人工设计基线的架构与算法优化。这为发现下一代基础模型确立了一个强有力的范式,标志着向递归自我改进迈出的明确一步。

智能体式神经架构发现:AIRA-Compose与AIRA-Design:论文配图
图 2:AIRA-Compose 管道。我们将 Composer 重新构建为等效的 AIRS-Bench 任务。这些任务指示代理结合预定义的计算原语来组装 16 层小型架构。使用 AIRA-dojo 工具运行任务,并以 6 个 LLM 作为核心推理模型。然后对搜索结果进行排名、聚合并缩放至 350M、1B 和 3B 参数大小。