论文

基于 LLM 的迭代神经架构搜索的收敛理论:具有闭式代理可靠性的参数交叉熵框架

Convergence Theory for Iterative LLM-Based Neural Architecture Search: A Parametric Cross-Entropy Framework with Closed-Form Proxy Reliability

模型推理推理搜索与路径规划

摘要

大语言模型 (LLM) 越来越多地用作迭代神经架构搜索 (NAS) 中的生成器,但此类算法不存在正式的收敛理论。我们将迭代 LLM-NAS 建模为可执行程序上的参数交叉熵(CE)方法,并证明了六个结果:(1)精英架构上的迭代 LLM 微调 相当于仅限于 LLM 参数系列的 CE 更新; (2) 期望的架构质量跨周期单调非递减; (3) 精英集概率以几何速率 C_t >= 1-(1-rho_0)^t 收敛到固定点; (4)在一阶马尔可夫词元错误模型下,基于增量的生成实现了比全代码生成严格更高的有效生成率; (5) MinHash-Jaccard新颖性过滤器防止模式崩溃; (6) 代理可靠性承认封闭形式 rho_S = (6/pi) arcsin(rho_P(SNR)/2),产生实用的诊断 sigma^2_arch >> sigma^2_noise 作为基于可信代理的排名的必要条件。对 22 个周期、三个 LLM、六个数据集实验(使用 3,300 个生成的架构)进行的测试定量地证实了两个预测,其中两个在效果方向水平上,并解释了先前根据经验报告但未解释的代理可靠性天花板效应。