论文

智能体神经架构搜索

Agentic Neural Architecture Search

应用与实践科学研究

摘要

神经架构搜索(NAS)方法日益高效,但仍受制于需要大量领域专长、且须为每个新任务重建的手工搜索空间。大语言模型(LLM)可以在开放式空间生成架构,但如何最优划分LLM驱动设计与NAS驱动搜索之间的劳动仍未探索。我们提出桥接两种范式的机制:LLM产出高质量种子架构,然后把它分解为“开槽架构”——带命名、可互换模块槽的脚手架,自动为传统NAS定义有界、任务专属的搜索空间而无需手工工程。我们在AgentNAS中实例化该机制:模块化三阶段管线,每个组件的贡献可独立度量。在跨分类、稠密回归、分割与多标签标注、多样模态(NAS-Bench-360与Unseen NAS)的17个任务上:AgentNAS在11个任务上确立新的最先进——超越包括任务专属专家设计在内的已发布基线。消融研究显示两种搜索机制广泛互补:LLM生成的种子已在多数任务上超过已发布基线,NAS在多数情况下经槽间组合重组交付额外增益——独立LLM采样无法复制的一种搜索模式。这些模式跨三个不同能力级别的LLM成立,确认劳动划分是鲁棒的。代码见https://github.com/alroimfebruary/AgentNAS。

智能体神经架构搜索:论文配图
图 1:AgentNAS 管道。第一阶段迭代地提示大语言模型提出、实施和训练候选架构,返回种子架构及其训练配方。给定更新的排行榜和自动生成的摘要以及所提议架构的代理分数,LLM 会迭代改进架构直到饱和。第 2 阶段将种子分解为具有每个时隙替代方案的时隙架构,定义特定于任务的搜索空间。第三阶段利用传统 NAS 探索这一领域。每个方块代表一个槽;完整的序列表示候选架构。我们展示了时隙架构搜索空间上三种最标准 NAS 算法的示例。