论文

基于 Delta 的神经架构搜索:LLM 微调 通过代码差异

Delta-Based Neural Architecture Search: LLM Fine-Tuning via Code Diffs

摘要

大语言模型 (LLM) 显示出神经架构生成的强大潜力,但现有方法从头开始生成完整的模型实现 - 计算成本昂贵且生成冗长的代码。我们提出增量代码生成,其中经过微调的 LLM 生成紧凑的统一差异(增量)以细化基线架构,而不是合成整个模型。我们的流程通过 LoRA 在 LEMUR 数据集的策划架构上迭代地微调 LLM,并使用 MinHash-Jaccard 新颖性过滤来实现结构多样性。我们使用 22 周期协议(每个 LLM 1,100 个候选)跨六个数据集(CIFAR-10、CIFAR-100、MNIST、SVHN、ImageNette、CelebA)评估三个 7B 级 LLM(DeepSeek-Coder-7B、Qwen2.5-Coder-7B 和 Mistral-7B)。这三者都大大超过了全代基线(50.6%的有效率,42.3%的平均第一时期准确率):DeepSeek-Coder达到75.3%的有效率和65.8%的平均准确率; Qwen2.5-编码器72.1%/64.6%;米斯特拉尔 66.6%/66.1%。在 CIFAR-10 上,第一历元的最佳准确率达到 85.5% (Mistral)、85.2% (DeepSeek)、80.6% (Qwen)——远高于 Gu 等人的全生成的 63.98% 和并发方法的 71.5%。输出长度为 30-50 行,而全代则为 200 行以上(减少 75-85%)。一项 50 时期的研究证实了 1 时期代理保留了排名(Mistral:Spearman $ρ$ = 0.926)。基于 Delta 的生成是一种词元高效、多域、与 LLM 无关的替代方案,可替代 LLM 驱动的 NAS 的全模型综合。